ОСНОВНОЕ
Стриминг
Установите stream: true, чтобы получать ответ по мере генерации как server-sent events (SSE), совместимые с OpenAI.
Как это работает
Каждое событие — строка data: {...} с чанком в формате chat.completion.chunk. Поток завершается строкой data: [DONE]. Токены reasoning-моделей приходят в delta.reasoning_content.
i
Резервное переключение (failover) возможно только до первого байта. Как только первое событие ушло клиенту, ответ закреплён за текущим маршрутом, и последующая ошибка приходит внутри потока как событие error.
Использование и токены
Финальный чанк несёт объект usage с числом токенов. Списание с баланса происходит по фактическому расходу после завершения потока.
ДалееСтруктурированный вывод →