ElevenLabs
## С чего начать
Выберите модель во вкладке Аудио, откройте её настройки и подберите голос в
библиотеке — там есть поиск, фильтры по полу, возрасту, акценту и применению, а
также прослушивание. Отмеченные сердечком голоса попадают в раздел «Избранное».
Дальше пришлите текст (для озвучки) или аудиофайл (для смены голоса) — и
запускайте генерацию. Стоимость считается по объёму: у озвучки за символы, у
смены голоса за длительность аудио, поэтому цена показывается до запуска.
## Выбор голоса решает больше, чем настройки
Это главный параметр. Голос должен быть близок к желаемой подаче: если запись
голоса громкая и энергичная, тег шёпота на нём почти не сработает. Подбирайте
голос под задачу, а не пытайтесь вытянуть неподходящий настройками.
## Настройки
Стабильность — самый влиятельный ползунок:
- ниже — эмоциональнее и выразительнее, но выше риск артефактов;
- середина — ближе всего к оригинальной записи голоса, сбалансированно;
- выше — максимально ровно и предсказуемо, но голос хуже откликается на
указания в тексте.
Если пользуетесь аудио-тегами, держите стабильность в нижней или средней части
диапазона: на высокой модель почти перестаёт на них реагировать.
Схожесть и усиление диктора влияют на близость к оригиналу.
Темп речи принимается в узком диапазоне — заметно ускорить или замедлить
речь им не получится, для пауз используйте пунктуацию.
Часть настроек действует не на всех моделях. Недоступные показаны погашенными с
пояснением — это не ошибка.
## Пунктуация и регистр
- Многоточие даёт паузу и «вес» фразе.
- ЗАГЛАВНЫЕ усиливают акцент на слове.
- Обычная пунктуация задаёт естественный ритм речи.
Пример: Это был ОЧЕНЬ длинный день … меня никто не слушает.
Теги разметки пауз в формате SSML моделью v3 не поддерживаются — управляйте
паузами пунктуацией и структурой текста.
## Аудио-теги
На модели v3 подачу можно направлять тегами в квадратных скобках прямо в тексте.
Тег влияет на ту реплику, внутри которой стоит.
Голос и эмоции:
[laughs], [laughs harder], [starts laughing], [wheezing], [whispers],
[sighs], [exhales], [sarcastic], [curious], [excited], [crying],
[snorts], [mischievously]
Пример: [whispers] Я и не знал, что так бывает.
Звуковые эффекты:
[applause], [clapping], [gunshot], [explosion], [swallows], [gulps]
Пример: [applause] Спасибо, что пришли! [gunshot] Что это было?
Экспериментальные:
[strong X accent] (подставьте нужный акцент), [sings], [woo]
Эти работают нестабильно и по-разному на разных голосах — проверяйте до того,
как использовать всерьёз.
⚠️ Действие тега зависит от выбранного голоса. Не ждите, что спокойный
медитативный голос закричит по тегу [shout], а энергичный убедительно
прошепчет.
## Если результат не тот
- Модель иногда меняет тон в середине дорожки — это не лечится настройками,
проще перегенерировать.
- Тег не сработал — вероятнее всего дело в голосе, а не в теге: попробуйте
другой голос или снизьте стабильность.
- Нужны паузы — ставьте многоточия, а не описывайте паузу словами.