toolcall.
Модели13 авг. 2026 г., 20:35 UTC

OpenAI тестирует Ultrafast mode для GPT-5.6 Sol

API-режим на Cerebras запускает топовую модель OpenAI до 14x быстрее Standard processing для задач, где важны секунды.

OpenAI тестирует Ultrafast - новый API-режим, в котором GPT-5.6 Sol работает до 14x быстрее Standard processing. Компания говорит, что инфраструктура на Cerebras может генерировать до 750 output tokens в секунду и при этом использовать самую сильную модель Sol.

Смысл здесь не в новой модельной линейке, а в latency. OpenAI утверждает, что для real-time сценариев командам обычно приходилось выбирать меньшие или более специализированные модели. Ultrafast должен перенести frontier reasoning в рабочие процессы, где несколько секунд ожидания уже меняют пользовательский опыт или бизнес-результат.

OpenAI называет среди первых сценариев incident response, финансовые исследования, security analysis, customer support, voice, commerce и live experimentation. Внутри компании режим тестировали для чтения логов, traces и командных обсуждений во время живых инцидентов, а также для ускорения research loops, которые раньше уходили в overnight batches.

Доступ пока ограничен preview для выбранных клиентов, расширение обещают по мере роста capacity. Для разработчиков главный сигнал в том, что скорость inference становится отдельной платформенной характеристикой: OpenAI конкурирует уже не только качеством и ценой моделей, но и тем, достаточно ли быстро самые сильные модели отвечают для interactive production systems.

Источники

Упоминаются

ai-infrastructuredeveloper-toolsinferenceopenai