Pailot

Текст в речь (TTS)

Синтез речи из текста в процессах Pailot

TTS (text-to-speech — текст в речь) — синтез аудио из строки. Голос, формат и скорость задаются у выбранного провайдера.

С TTS в Pailot вы можете:

  • Синтезировать речь через OpenAI, Deepgram Aura, ElevenLabs, Cartesia, Google Cloud, Azure Speech и PlayHT
  • Выбирать голос, формат (mp3, wav, opus и др.) и скорость
  • У ElevenLabs и PlayHT — стабильность, сходство и клонирование голоса
  • У Google и Azure — язык, тон, темп и стиль (нейронные голоса)

Нужен ключ API (Application Programming Interface — программный интерфейс) провайдера. У PlayHT дополнительно userId (заголовок X-USER-ID).

Блок ставят на холст как отдельный шаг или прикрепляют к агенту. Ключ — в переменных окружения рабочего пространства.

Инструменты

tts_openai

Синтез через модели OpenAI TTS.

Вход

ПараметрТипОбязательныйОписание
textstringДаТекст для озвучки
apiKeystringДаКлюч API OpenAI
modelstringНетМодель TTS: tts-1, tts-1-hd или gpt-4o-mini-tts
voicestringНетГолос: alloy, ash, ballad, cedar, coral, echo, marin, sage, shimmer, verse
responseFormatstringНетФормат аудио: mp3, opus, aac, flac, wav, pcm
speednumberНетСкорость речи (0.25–4.0, по умолчанию 1.0)

Выход

ПараметрТипОписание
audioUrlstringURL сгенерированного аудио
audioFilefileОбъект аудиофайла
durationnumberДлительность в секундах
characterCountnumberЧисло обработанных символов
formatstringФормат аудио
providerstringИспользованный провайдер TTS

tts_deepgram

Синтез через Deepgram Aura.

Вход

ПараметрТипОбязательныйОписание
textstringДаТекст для озвучки
apiKeystringДаКлюч API Deepgram
modelstringНетМодель или голос Deepgram (например aura-asteria-en, aura-luna-en)
voicestringНетИдентификатор голоса (альтернатива model)
encodingstringНетКодирование: linear16, mp3, opus, aac, flac
sampleRatenumberНетЧастота дискретизации: 8000, 16000, 24000, 48000
bitRatenumberНетБитрейт для сжатых форматов
containerstringНетКонтейнер: none, wav, ogg

Выход

ПараметрТипОписание
audioUrlstringURL сгенерированного аудио
audioFilefileОбъект аудиофайла
durationnumberДлительность в секундах
characterCountnumberЧисло обработанных символов
formatstringФормат аудио
providerstringИспользованный провайдер TTS

tts_elevenlabs

Синтез через голоса ElevenLabs.

Вход

ПараметрТипОбязательныйОписание
textstringДаТекст для озвучки
voiceIdstringДаID голоса
apiKeystringДаКлюч API ElevenLabs
modelIdstringНетМодель (например eleven_monolingual_v1, eleven_turbo_v2_5, eleven_flash_v2_5)
stabilitynumberНетСтабильность голоса (0.0–1.0, по умолчанию 0.5)
similarityBoostnumberНетУсиление сходства (0.0–1.0, по умолчанию 0.8)
stylenumberНетПреувеличение стиля (0.0–1.0)
useSpeakerBoostbooleanНетУсиление говорящего (по умолчанию true)

Выход

ПараметрТипОписание
audioUrlstringURL сгенерированного аудио
audioFilefileОбъект аудиофайла
durationnumberДлительность в секундах
characterCountnumberЧисло обработанных символов
formatstringФормат аудио
providerstringИспользованный провайдер TTS

tts_cartesia

Синтез через Cartesia Sonic (низкая задержка).

Вход

ПараметрТипОбязательныйОписание
textstringДаТекст для озвучки
apiKeystringДаКлюч API Cartesia
modelIdstringНетID модели: sonic-english, sonic-multilingual
voicestringНетID голоса или эмбеддинг
languagestringНетКод языка (en, es, fr, de, it, pt и др.)
outputFormatjsonНетФормат вывода: container, encoding, sampleRate
speednumberНетМножитель скорости
emotionarrayНетТеги эмоций для Sonic-3 (например ['positivity:high'])

Выход

ПараметрТипОписание
audioUrlstringURL сгенерированного аудио
audioFilefileОбъект аудиофайла
durationnumberДлительность в секундах
characterCountnumberЧисло обработанных символов
formatstringФормат аудио
providerstringИспользованный провайдер TTS

tts_google

Синтез через Google Cloud Text-to-Speech.

Вход

ПараметрТипОбязательныйОписание
textstringДаТекст для озвучки
apiKeystringДаКлюч API Google Cloud
voiceIdstringНетID голоса (например en-US-Neural2-A, en-US-Wavenet-D)
languageCodestringДаКод языка (например en-US, es-ES, fr-FR)
genderstringНетПол голоса: MALE, FEMALE, NEUTRAL
audioEncodingstringНетКодирование: LINEAR16, MP3, OGG_OPUS, MULAW, ALAW
speakingRatenumberНетТемп речи (0.25–2.0, по умолчанию 1.0)
pitchnumberНетВысота голоса (−20.0–20.0, по умолчанию 0.0)
volumeGainDbnumberНетГромкость в дБ (−96.0–16.0)
sampleRateHertznumberНетЧастота дискретизации в Гц
effectsProfileIdarrayНетПрофиль эффектов (например ['headphone-class-device'])

Выход

ПараметрТипОписание
audioUrlstringURL сгенерированного аудио
audioFilefileОбъект аудиофайла
durationnumberДлительность в секундах
characterCountnumberЧисло обработанных символов
formatstringФормат аудио
providerstringИспользованный провайдер TTS

tts_azure

Синтез через Azure Cognitive Services (Speech).

Вход

ПараметрТипОбязательныйОписание
textstringДаТекст для озвучки
apiKeystringДаКлюч API Azure Speech Services
voiceIdstringНетID голоса (например en-US-JennyNeural, en-US-GuyNeural)
regionstringНетРегион Azure (например eastus, westus, westeurope)
outputFormatstringНетФормат выходного аудио
ratestringНетТемп речи (например +10%, −20%, 1.5)
pitchstringНетВысота голоса (например +5Hz, −2st, low)
stylestringНетСтиль речи (cheerful, sad, angry — только нейронные голоса)
styleDegreenumberНетИнтенсивность стиля (0.01–2.0)
rolestringНетРоль (например Girl, Boy, YoungAdultFemale)

Выход

ПараметрТипОписание
audioUrlstringURL сгенерированного аудио
audioFilefileОбъект аудиофайла
durationnumberДлительность в секундах
characterCountnumberЧисло обработанных символов
formatstringФормат аудио
providerstringИспользованный провайдер TTS

tts_playht

Синтез через PlayHT, в том числе клонирование голоса.

Вход

ПараметрТипОбязательныйОписание
textstringДаТекст для озвучки
apiKeystringДаКлюч API PlayHT (заголовок AUTHORIZATION)
userIdstringДаID пользователя PlayHT (заголовок X-USER-ID)
voicestringНетID голоса или URL манифеста
qualitystringНетКачество: draft, standard, premium
outputFormatstringНетФормат: mp3, wav, ogg, flac, mulaw
speednumberНетМножитель скорости (0.5–2.0)
temperaturenumberНетСлучайность (0.0–2.0)
voiceGuidancenumberНетСтабильность голоса (1.0–6.0)
textGuidancenumberНетСледование тексту (1.0–6.0)
sampleRatenumberНетЧастота дискретизации: 8000, 16000, 22050, 24000, 44100, 48000

Выход

ПараметрТипОписание
audioUrlstringURL сгенерированного аудио
audioFilefileОбъект аудиофайла
durationnumberДлительность в секундах
characterCountnumberЧисло обработанных символов
formatstringФормат аудио
providerstringИспользованный провайдер TTS
На этой странице

На этой странице

Получить доступ
Копилот собирает процесс. Менеджер запускает сам. Можно поставить в контур компании.
Получить доступ