Речь в текст (STT)
Расшифровка аудио и видео в текст в процессах Pailot
STT (speech-to-text — речь в текст) — блок расшифровки аудио и видео через модели провайдеров. На выходе — текст, при необходимости с метками времени, разделением говорящих и переводом.
С STT в Pailot вы можете:
- Расшифровывать файлы и URL через OpenAI Whisper, Deepgram, ElevenLabs, AssemblyAI и Google Gemini
- Задавать язык или
auto, метки времени (none, sentence, word) и подсказку модели
- Включать диаризацию (разделение говорящих) у Deepgram и AssemblyAI
- У AssemblyAI — анализ тональности, сущности, маскирование PII (personally identifiable information — персональные данные) и автосводку
- У Whisper — перевод записи на английский
Нужен ключ API (Application Programming Interface — программный интерфейс) выбранного провайдера. Укажите источник: audioFile, ссылка из предыдущего блока (audioFileReference) или audioUrl.
Блок ставят на холст как отдельный шаг или прикрепляют к агенту. Ключ — в переменных окружения рабочего пространства.
Расшифровка через OpenAI Whisper. Можно перевести запись на английский.
| Параметр | Тип | Обязательный | Описание |
|---|
provider | string | Да | Провайдер STT (whisper) |
apiKey | string | Да | Ключ API OpenAI |
model | string | Нет | Модель Whisper (по умолчанию whisper-1) |
audioFile | file | Нет | Аудио- или видеофайл для расшифровки |
audioFileReference | file | Нет | Ссылка на файл из предыдущих блоков |
audioUrl | string | Нет | URL аудио или видео |
language | string | Нет | Код языка (например en, es, fr) или auto для автоопределения |
timestamps | string | Нет | Детализация меток времени: none, sentence или word |
translateToEnglish | boolean | Нет | Перевести запись на английский |
prompt | string | Нет | Текст, который задаёт стиль модели или продолжает предыдущий фрагмент. Помогает с именами и контекстом |
temperature | number | Нет | Температура выборки от 0 до 1. Выше — разнообразнее, ниже — стабильнее |
| Параметр | Тип | Описание |
|---|
transcript | string | Полный текст расшифровки |
segments | array | Сегменты с метками времени |
language | string | Определённый или заданный язык |
duration | number | Длительность аудио в секундах |
Расшифровка через Deepgram, с опциональной диаризацией.
| Параметр | Тип | Обязательный | Описание |
|---|
provider | string | Да | Провайдер STT (deepgram) |
apiKey | string | Да | Ключ API Deepgram |
model | string | Нет | Модель Deepgram (nova-3, nova-2, whisper-large и др.) |
audioFile | file | Нет | Аудио- или видеофайл для расшифровки |
audioFileReference | file | Нет | Ссылка на файл из предыдущих блоков |
audioUrl | string | Нет | URL аудио или видео |
language | string | Нет | Код языка (например en, es, fr) или auto для автоопределения |
timestamps | string | Нет | Детализация меток времени: none, sentence или word |
diarization | boolean | Нет | Включить разделение говорящих |
| Параметр | Тип | Описание |
|---|
transcript | string | Полный текст расшифровки |
segments | array | Сегменты с метками времени и метками говорящих |
language | string | Определённый или заданный язык |
duration | number | Длительность аудио в секундах |
confidence | number | Общая оценка уверенности |
Расшифровка через ElevenLabs (модели scribe).
| Параметр | Тип | Обязательный | Описание |
|---|
provider | string | Да | Провайдер STT (elevenlabs) |
apiKey | string | Да | Ключ API ElevenLabs |
model | string | Нет | Модель ElevenLabs (scribe_v1, scribe_v1_experimental) |
audioFile | file | Нет | Аудио- или видеофайл для расшифровки |
audioFileReference | file | Нет | Ссылка на файл из предыдущих блоков |
audioUrl | string | Нет | URL аудио или видео |
language | string | Нет | Код языка (например en, es, fr) или auto для автоопределения |
timestamps | string | Нет | Детализация меток времени: none, sentence или word |
| Параметр | Тип | Описание |
|---|
transcript | string | Полный текст расшифровки |
segments | array | Сегменты с метками времени |
language | string | Определённый или заданный язык |
duration | number | Длительность аудио в секундах |
confidence | number | Общая оценка уверенности |
Расшифровка через AssemblyAI: диаризация, тональность, сущности, маскирование PII и сводка.
| Параметр | Тип | Обязательный | Описание |
|---|
provider | string | Да | Провайдер STT (assemblyai) |
apiKey | string | Да | Ключ API AssemblyAI |
model | string | Нет | Модель AssemblyAI (по умолчанию best) |
audioFile | file | Нет | Аудио- или видеофайл для расшифровки |
audioFileReference | file | Нет | Ссылка на файл из предыдущих блоков |
audioUrl | string | Нет | URL аудио или видео |
language | string | Нет | Код языка (например en, es, fr) или auto для автоопределения |
timestamps | string | Нет | Детализация меток времени: none, sentence или word |
diarization | boolean | Нет | Включить разделение говорящих |
sentiment | boolean | Нет | Включить анализ тональности |
entityDetection | boolean | Нет | Включить поиск сущностей |
piiRedaction | boolean | Нет | Маскировать персональные данные (PII) |
summarization | boolean | Нет | Включить автоматическую сводку |
| Параметр | Тип | Описание |
|---|
transcript | string | Полный текст расшифровки |
segments | array | Сегменты с метками времени и метками говорящих |
language | string | Определённый или заданный язык |
duration | number | Длительность аудио в секундах |
confidence | number | Общая оценка уверенности |
sentiment | array | Результаты анализа тональности |
entities | array | Найденные сущности |
summary | string | Автоматическая сводка |
Расшифровка через Google Gemini (мультимодальная модель).
| Параметр | Тип | Обязательный | Описание |
|---|
provider | string | Да | Провайдер STT (gemini) |
apiKey | string | Да | Ключ API Google |
model | string | Нет | Модель Gemini (по умолчанию gemini-2.5-flash) |
audioFile | file | Нет | Аудио- или видеофайл для расшифровки |
audioFileReference | file | Нет | Ссылка на файл из предыдущих блоков |
audioUrl | string | Нет | URL аудио или видео |
language | string | Нет | Код языка (например en, es, fr) или auto для автоопределения |
timestamps | string | Нет | Детализация меток времени: none, sentence или word |
| Параметр | Тип | Описание |
|---|
transcript | string | Полный текст расшифровки |
segments | array | Сегменты с метками времени |
language | string | Определённый или заданный язык |
duration | number | Длительность аудио в секундах |
confidence | number | Общая оценка уверенности |