palatine/speech-to-text-stream
Расшифровка речи (STT)Palatine — потоковое распознавание речи в реальном времени: WebSocket-сессия, промежуточные результаты по мере речи (формат событий OpenAI Realtime transcription). Вход — PCM 16 бит, 8–48 кГц.
Провайдеров
1
Цена / мин
0.29 ₽/мин
Макс. длительность
60 мин
Аудио потока
PCM16 · моно
8–48 кГц · реком. 16
Тип
Расшифровка речи (STT)
Разработчик
palatine
Провайдеры
| Статус | Провайдер | Цена / мин |
|---|---|---|
| Онлайн | Palatine Speech | 0.29 ₽/мин |
Цены обновлены: 22.08.2026
Примеры использования
bash
# WebSocket-эндпоинт — curl не подходит; консольный клиент: websocat.
websocat "wss://api.tsarrouter.ru/v1/realtime/transcriptions?model=palatine/speech-to-text-stream" \
-H "Authorization: Bearer sk-tsar-ваш-ключ"
# Клиент шлёт JSON-события (аудио — base64 PCM16LE mono, 8–48 кГц):
# {"type":"session.update","session":{"audio":{"input":{"format":{"type":"audio/pcm","rate":16000}}}}}
# {"type":"input_audio_buffer.append","audio":"<base64 PCM16>"} # чанки ~200 мс
# {"type":"input_audio_buffer.commit"} # конец фразы
# Сервер отвечает (формат OpenAI Realtime transcription):
# conversation.item.input_audio_transcription.delta # текст по мере речи
# conversation.item.input_audio_transcription.completed # финал + usage.seconds