Текст в речь (TTS)
Синтез речи из текста в процессах Pailot
TTS (text-to-speech — текст в речь) — синтез аудио из строки. Голос, формат и скорость задаются у выбранного провайдера.
С TTS в Pailot вы можете:
- Синтезировать речь через OpenAI, Deepgram Aura, ElevenLabs, Cartesia, Google Cloud, Azure Speech и PlayHT
- Выбирать голос, формат (mp3, wav, opus и др.) и скорость
- У ElevenLabs и PlayHT — стабильность, сходство и клонирование голоса
- У Google и Azure — язык, тон, темп и стиль (нейронные голоса)
Нужен ключ API (Application Programming Interface — программный интерфейс) провайдера. У PlayHT дополнительно userId (заголовок X-USER-ID).
Блок ставят на холст как отдельный шаг или прикрепляют к агенту. Ключ — в переменных окружения рабочего пространства.
Синтез через модели OpenAI TTS.
| Параметр | Тип | Обязательный | Описание |
|---|
text | string | Да | Текст для озвучки |
apiKey | string | Да | Ключ API OpenAI |
model | string | Нет | Модель TTS: tts-1, tts-1-hd или gpt-4o-mini-tts |
voice | string | Нет | Голос: alloy, ash, ballad, cedar, coral, echo, marin, sage, shimmer, verse |
responseFormat | string | Нет | Формат аудио: mp3, opus, aac, flac, wav, pcm |
speed | number | Нет | Скорость речи (0.25–4.0, по умолчанию 1.0) |
| Параметр | Тип | Описание |
|---|
audioUrl | string | URL сгенерированного аудио |
audioFile | file | Объект аудиофайла |
duration | number | Длительность в секундах |
characterCount | number | Число обработанных символов |
format | string | Формат аудио |
provider | string | Использованный провайдер TTS |
Синтез через Deepgram Aura.
| Параметр | Тип | Обязательный | Описание |
|---|
text | string | Да | Текст для озвучки |
apiKey | string | Да | Ключ API Deepgram |
model | string | Нет | Модель или голос Deepgram (например aura-asteria-en, aura-luna-en) |
voice | string | Нет | Идентификатор голоса (альтернатива model) |
encoding | string | Нет | Кодирование: linear16, mp3, opus, aac, flac |
sampleRate | number | Нет | Частота дискретизации: 8000, 16000, 24000, 48000 |
bitRate | number | Нет | Битрейт для сжатых форматов |
container | string | Нет | Контейнер: none, wav, ogg |
| Параметр | Тип | Описание |
|---|
audioUrl | string | URL сгенерированного аудио |
audioFile | file | Объект аудиофайла |
duration | number | Длительность в секундах |
characterCount | number | Число обработанных символов |
format | string | Формат аудио |
provider | string | Использованный провайдер TTS |
Синтез через голоса ElevenLabs.
| Параметр | Тип | Обязательный | Описание |
|---|
text | string | Да | Текст для озвучки |
voiceId | string | Да | ID голоса |
apiKey | string | Да | Ключ API ElevenLabs |
modelId | string | Нет | Модель (например eleven_monolingual_v1, eleven_turbo_v2_5, eleven_flash_v2_5) |
stability | number | Нет | Стабильность голоса (0.0–1.0, по умолчанию 0.5) |
similarityBoost | number | Нет | Усиление сходства (0.0–1.0, по умолчанию 0.8) |
style | number | Нет | Преувеличение стиля (0.0–1.0) |
useSpeakerBoost | boolean | Нет | Усиление говорящего (по умолчанию true) |
| Параметр | Тип | Описание |
|---|
audioUrl | string | URL сгенерированного аудио |
audioFile | file | Объект аудиофайла |
duration | number | Длительность в секундах |
characterCount | number | Число обработанных символов |
format | string | Формат аудио |
provider | string | Использованный провайдер TTS |
Синтез через Cartesia Sonic (низкая задержка).
| Параметр | Тип | Обязательный | Описание |
|---|
text | string | Да | Текст для озвучки |
apiKey | string | Да | Ключ API Cartesia |
modelId | string | Нет | ID модели: sonic-english, sonic-multilingual |
voice | string | Нет | ID голоса или эмбеддинг |
language | string | Нет | Код языка (en, es, fr, de, it, pt и др.) |
outputFormat | json | Нет | Формат вывода: container, encoding, sampleRate |
speed | number | Нет | Множитель скорости |
emotion | array | Нет | Теги эмоций для Sonic-3 (например ['positivity:high']) |
| Параметр | Тип | Описание |
|---|
audioUrl | string | URL сгенерированного аудио |
audioFile | file | Объект аудиофайла |
duration | number | Длительность в секундах |
characterCount | number | Число обработанных символов |
format | string | Формат аудио |
provider | string | Использованный провайдер TTS |
Синтез через Google Cloud Text-to-Speech.
| Параметр | Тип | Обязательный | Описание |
|---|
text | string | Да | Текст для озвучки |
apiKey | string | Да | Ключ API Google Cloud |
voiceId | string | Нет | ID голоса (например en-US-Neural2-A, en-US-Wavenet-D) |
languageCode | string | Да | Код языка (например en-US, es-ES, fr-FR) |
gender | string | Нет | Пол голоса: MALE, FEMALE, NEUTRAL |
audioEncoding | string | Нет | Кодирование: LINEAR16, MP3, OGG_OPUS, MULAW, ALAW |
speakingRate | number | Нет | Темп речи (0.25–2.0, по умолчанию 1.0) |
pitch | number | Нет | Высота голоса (−20.0–20.0, по умолчанию 0.0) |
volumeGainDb | number | Нет | Громкость в дБ (−96.0–16.0) |
sampleRateHertz | number | Нет | Частота дискретизации в Гц |
effectsProfileId | array | Нет | Профиль эффектов (например ['headphone-class-device']) |
| Параметр | Тип | Описание |
|---|
audioUrl | string | URL сгенерированного аудио |
audioFile | file | Объект аудиофайла |
duration | number | Длительность в секундах |
characterCount | number | Число обработанных символов |
format | string | Формат аудио |
provider | string | Использованный провайдер TTS |
Синтез через Azure Cognitive Services (Speech).
| Параметр | Тип | Обязательный | Описание |
|---|
text | string | Да | Текст для озвучки |
apiKey | string | Да | Ключ API Azure Speech Services |
voiceId | string | Нет | ID голоса (например en-US-JennyNeural, en-US-GuyNeural) |
region | string | Нет | Регион Azure (например eastus, westus, westeurope) |
outputFormat | string | Нет | Формат выходного аудио |
rate | string | Нет | Темп речи (например +10%, −20%, 1.5) |
pitch | string | Нет | Высота голоса (например +5Hz, −2st, low) |
style | string | Нет | Стиль речи (cheerful, sad, angry — только нейронные голоса) |
styleDegree | number | Нет | Интенсивность стиля (0.01–2.0) |
role | string | Нет | Роль (например Girl, Boy, YoungAdultFemale) |
| Параметр | Тип | Описание |
|---|
audioUrl | string | URL сгенерированного аудио |
audioFile | file | Объект аудиофайла |
duration | number | Длительность в секундах |
characterCount | number | Число обработанных символов |
format | string | Формат аудио |
provider | string | Использованный провайдер TTS |
Синтез через PlayHT, в том числе клонирование голоса.
| Параметр | Тип | Обязательный | Описание |
|---|
text | string | Да | Текст для озвучки |
apiKey | string | Да | Ключ API PlayHT (заголовок AUTHORIZATION) |
userId | string | Да | ID пользователя PlayHT (заголовок X-USER-ID) |
voice | string | Нет | ID голоса или URL манифеста |
quality | string | Нет | Качество: draft, standard, premium |
outputFormat | string | Нет | Формат: mp3, wav, ogg, flac, mulaw |
speed | number | Нет | Множитель скорости (0.5–2.0) |
temperature | number | Нет | Случайность (0.0–2.0) |
voiceGuidance | number | Нет | Стабильность голоса (1.0–6.0) |
textGuidance | number | Нет | Следование тексту (1.0–6.0) |
sampleRate | number | Нет | Частота дискретизации: 8000, 16000, 22050, 24000, 44100, 48000 |
| Параметр | Тип | Описание |
|---|
audioUrl | string | URL сгенерированного аудио |
audioFile | file | Объект аудиофайла |
duration | number | Длительность в секундах |
characterCount | number | Число обработанных символов |
format | string | Формат аудио |
provider | string | Использованный провайдер TTS |