Pailot

Речь в текст (STT)

Расшифровка аудио и видео в текст в процессах Pailot

STT (speech-to-text — речь в текст) — блок расшифровки аудио и видео через модели провайдеров. На выходе — текст, при необходимости с метками времени, разделением говорящих и переводом.

С STT в Pailot вы можете:

  • Расшифровывать файлы и URL через OpenAI Whisper, Deepgram, ElevenLabs, AssemblyAI и Google Gemini
  • Задавать язык или auto, метки времени (none, sentence, word) и подсказку модели
  • Включать диаризацию (разделение говорящих) у Deepgram и AssemblyAI
  • У AssemblyAI — анализ тональности, сущности, маскирование PII (personally identifiable information — персональные данные) и автосводку
  • У Whisper — перевод записи на английский

Нужен ключ API (Application Programming Interface — программный интерфейс) выбранного провайдера. Укажите источник: audioFile, ссылка из предыдущего блока (audioFileReference) или audioUrl.

Блок ставят на холст как отдельный шаг или прикрепляют к агенту. Ключ — в переменных окружения рабочего пространства.

Инструменты

stt_whisper

Расшифровка через OpenAI Whisper. Можно перевести запись на английский.

Вход

ПараметрТипОбязательныйОписание
providerstringДаПровайдер STT (whisper)
apiKeystringДаКлюч API OpenAI
modelstringНетМодель Whisper (по умолчанию whisper-1)
audioFilefileНетАудио- или видеофайл для расшифровки
audioFileReferencefileНетСсылка на файл из предыдущих блоков
audioUrlstringНетURL аудио или видео
languagestringНетКод языка (например en, es, fr) или auto для автоопределения
timestampsstringНетДетализация меток времени: none, sentence или word
translateToEnglishbooleanНетПеревести запись на английский
promptstringНетТекст, который задаёт стиль модели или продолжает предыдущий фрагмент. Помогает с именами и контекстом
temperaturenumberНетТемпература выборки от 0 до 1. Выше — разнообразнее, ниже — стабильнее

Выход

ПараметрТипОписание
transcriptstringПолный текст расшифровки
segmentsarrayСегменты с метками времени
languagestringОпределённый или заданный язык
durationnumberДлительность аудио в секундах

stt_deepgram

Расшифровка через Deepgram, с опциональной диаризацией.

Вход

ПараметрТипОбязательныйОписание
providerstringДаПровайдер STT (deepgram)
apiKeystringДаКлюч API Deepgram
modelstringНетМодель Deepgram (nova-3, nova-2, whisper-large и др.)
audioFilefileНетАудио- или видеофайл для расшифровки
audioFileReferencefileНетСсылка на файл из предыдущих блоков
audioUrlstringНетURL аудио или видео
languagestringНетКод языка (например en, es, fr) или auto для автоопределения
timestampsstringНетДетализация меток времени: none, sentence или word
diarizationbooleanНетВключить разделение говорящих

Выход

ПараметрТипОписание
transcriptstringПолный текст расшифровки
segmentsarrayСегменты с метками времени и метками говорящих
languagestringОпределённый или заданный язык
durationnumberДлительность аудио в секундах
confidencenumberОбщая оценка уверенности

stt_elevenlabs

Расшифровка через ElevenLabs (модели scribe).

Вход

ПараметрТипОбязательныйОписание
providerstringДаПровайдер STT (elevenlabs)
apiKeystringДаКлюч API ElevenLabs
modelstringНетМодель ElevenLabs (scribe_v1, scribe_v1_experimental)
audioFilefileНетАудио- или видеофайл для расшифровки
audioFileReferencefileНетСсылка на файл из предыдущих блоков
audioUrlstringНетURL аудио или видео
languagestringНетКод языка (например en, es, fr) или auto для автоопределения
timestampsstringНетДетализация меток времени: none, sentence или word

Выход

ПараметрТипОписание
transcriptstringПолный текст расшифровки
segmentsarrayСегменты с метками времени
languagestringОпределённый или заданный язык
durationnumberДлительность аудио в секундах
confidencenumberОбщая оценка уверенности

stt_assemblyai

Расшифровка через AssemblyAI: диаризация, тональность, сущности, маскирование PII и сводка.

Вход

ПараметрТипОбязательныйОписание
providerstringДаПровайдер STT (assemblyai)
apiKeystringДаКлюч API AssemblyAI
modelstringНетМодель AssemblyAI (по умолчанию best)
audioFilefileНетАудио- или видеофайл для расшифровки
audioFileReferencefileНетСсылка на файл из предыдущих блоков
audioUrlstringНетURL аудио или видео
languagestringНетКод языка (например en, es, fr) или auto для автоопределения
timestampsstringНетДетализация меток времени: none, sentence или word
diarizationbooleanНетВключить разделение говорящих
sentimentbooleanНетВключить анализ тональности
entityDetectionbooleanНетВключить поиск сущностей
piiRedactionbooleanНетМаскировать персональные данные (PII)
summarizationbooleanНетВключить автоматическую сводку

Выход

ПараметрТипОписание
transcriptstringПолный текст расшифровки
segmentsarrayСегменты с метками времени и метками говорящих
languagestringОпределённый или заданный язык
durationnumberДлительность аудио в секундах
confidencenumberОбщая оценка уверенности
sentimentarrayРезультаты анализа тональности
entitiesarrayНайденные сущности
summarystringАвтоматическая сводка

stt_gemini

Расшифровка через Google Gemini (мультимодальная модель).

Вход

ПараметрТипОбязательныйОписание
providerstringДаПровайдер STT (gemini)
apiKeystringДаКлюч API Google
modelstringНетМодель Gemini (по умолчанию gemini-2.5-flash)
audioFilefileНетАудио- или видеофайл для расшифровки
audioFileReferencefileНетСсылка на файл из предыдущих блоков
audioUrlstringНетURL аудио или видео
languagestringНетКод языка (например en, es, fr) или auto для автоопределения
timestampsstringНетДетализация меток времени: none, sentence или word

Выход

ПараметрТипОписание
transcriptstringПолный текст расшифровки
segmentsarrayСегменты с метками времени
languagestringОпределённый или заданный язык
durationnumberДлительность аудио в секундах
confidencenumberОбщая оценка уверенности
На этой странице

На этой странице

Получить доступ
Копилот собирает процесс. Менеджер запускает сам. Можно поставить в контур компании.
Получить доступ