Запустить аудитПолевые заметкиО нас
00Как мы поставляем Voice AI

Голосовой оператор в облаке или в вашем контуре

Демо показывает, как агент звучит. Эта страница - о том, что стоит за звонком: из чего собран оператор, какие есть варианты поставки, что нужно решить до цены и сколько стоит каждая часть.

01

Из чего состоит голосовой оператор

Отдельной «модели оператора», которую можно передать файлом, не существует. Это цепочка из нескольких частей, и каждая работает в реальном времени.

  1. 01Телефония

    Принимает звонок и передаёт звук в обе стороны: SIP-транк, Asterisk или ваша АТС.

    Звонок на ваш номер приходит через оператора связи и попадает в Asterisk, который отдаёт аудиопоток агенту.

  2. 02Распознавание речи

    Превращает голос звонящего в текст, пока он ещё говорит.

    «Здравствуйте, у меня клопы в двушке» становится текстом раньше, чем человек закончил фразу.

  3. 03Модель ответа

    Языковая модель решает, что сказать: по сценарию, вашим ценам и правилам.

    Знает прайс, задаёт по одному вопросу, не даёт скидок, которых нет, и возвращает разговор к записи.

  4. 04Синтез голоса

    Озвучивает ответ голосом оператора, с паузами, вздохами и интонацией.

    Первые звуки ответа начинают играть, пока модель ещё дописывает конец фразы.

  5. 05Интеграции

    Записывает результат туда, где с ним работают: CRM, календарь, таблица, мессенджер.

    После звонка в CRM появляется карточка: имя, телефон, запрос, дата визита, названная цена, итог.

Над этой цепочкой работает управление разговором: определить, что человек договорил, не перебить его на «угу», замолчать, когда перебивают, и заполнить паузу, если ответ задерживается. В демо всё это настроено, и именно это отличает живой разговор от автоответчика.

02

Куда уходит секунда

Человек ждёт ответа на паузе примерно в секунду. Вот как эта секунда распределилась на реальном звонке в наше демо.

от конца фразы до голоса1,09 с
Понять, что вы договорили, и сеть
0,48
Модель: первое предложение ответа
0,54
Синтез: первый звук
0,07
вы договорилиагент заговорил

Замер с демо-звонка 9 октября 2026 года, облачные модели. Для локальной установки эту разбивку нужно получить заново на ваших моделях и вашем железе: именно она решает, будет ли разговор живым.

03

Три варианта поставки

Вопрос «облако или своё» решает почти всё остальное: срок, бюджет, железо и то, насколько голос будет похож на демо.

Облако

Как в демо: модели у провайдеров, вы платите за минуты разговора.

Где работают модели
У провайдеров речи и языковых моделей
Где данные и записи
У провайдера, с настраиваемым сроком хранения
Голос и задержка
Как в демо
Железо
Не нужно
Срок до первой версии
Самый быстрый

Когда важны скорость запуска и качество голоса, а записи звонков у провайдера допустимы.

Ваш контур + облачные модели

Телефония, управление разговором, интеграции и данные у вас, модели вызываются по API.

Где работают модели
По API у провайдеров
Где данные и записи
У вас; провайдеру уходит только то, что нужно для ответа
Голос и задержка
Как в демо
Железо
Обычный сервер, без GPU
Срок до первой версии
Средний

Когда данные должны оставаться у вас, но доступ к внешним моделям из контура разрешён.

Полностью локально

Вся цепочка на ваших серверах, без обращений наружу.

Где работают модели
На ваших серверах
Где данные и записи
Только у вас
Голос и задержка
Проверяется заново: зависит от локальных моделей
Железо
Серверы с GPU
Срок до первой версии
Самый долгий: подбор моделей и нагрузочные тесты

Когда наружу не может уходить ничего, и под это готовы бюджет на железо и время на проверку.

04

Что нужно решить до цены

Цена и срок появляются после спецификации. Без неё в процессе вылезает тысяча и одна хотелка. Вот вопросы, на которые нужны ответы, с примерами.

  1. 01

    Где работает решение?

    Определяет вариант поставки, железо и половину бюджета.

    «Всё на наших серверах, наружу ничего» или «у нас, но облачные модели по API допустимы».

  2. 02

    Только озвучка или полноценный разговор?

    Синтез готового текста и оператор, который слушает, понимает и ведёт разговор, - разные по сложности системы.

    «Зачитывать статус заказа по номеру» или «принимать заявку и отвечать на вопросы».

  3. 03

    Какие задачи выполняет оператор?

    Каждый сценарий - это промпт, знания, проверки и тесты. Без примеров не оценить объём.

    «Принять заявку на дезинсекцию, назвать цену из прайса, записать на время и перевести на человека, если клиент спорит».

  4. 04

    Сколько одновременных звонков?

    От пиковой нагрузки зависят железо или стоимость облака.

    «В обычный день до 10, в пике до 30, ночью 1-2».

  5. 05

    С чем соединяем?

    Граница работ: что подключаете вы, а что делаем мы.

    «У нас Asterisk, отдаём SIP-транк, интеграцию с CRM делаем сами по вашему API».

  6. 06

    Какое железо есть?

    Для локального варианта: подбираем модели под ваше железо или железо под нужное качество.

    «Есть стойка в ЦОД, GPU нет, бюджет на закупку согласуем».

  7. 07

    Как принимаем результат?

    Без критериев приёмки любая доработка становится спором.

    «Десять согласованных сценариев проходят на нашей реальной линии, медианный ответ не дольше 1,5 секунды, перебивание работает».

05

Разные операторы - разная работа

Слово «оператор» скрывает очень разный объём. Два примера на одной и той же линии.

Квалифицирует и переводит

Выясняет, кто звонит и зачем, отвечает на типовые вопросы, записывает или переводит на человека с уже собранным контекстом.

АгентСлужба «ДомЧист», здравствуйте! Слушаю вас.

ЗвонящийУ нас тараканы, хочу узнать цену.

АгентАга, понимаю. Это квартира? Сколько комнат?

ЗвонящийДвушка.

АгентДля двушки обработка стоит четыре с половиной тысячи. Записать вас на завтра?

Один-два сценария, прайс, правила перевода на человека. Интеграция - запись в CRM.

Продаёт и оформляет

Работает с возражениями, предлагает альтернативы, проверяет наличие и слоты, оформляет заказ в ваших системах и подтверждает его.

ЗвонящийДорого. У конкурентов дешевле.

АгентПонимаю. У нас гарантия год и повторная обработка бесплатно. Если клопов немного, можно дешевле - холодным туманом.

ЗвонящийЛадно, давайте на субботу.

АгентТак, гляну мастеров... суббота, одиннадцать утра свободно. Оформляю.

Скрипты возражений, доступ к расписанию и остаткам в реальном времени, создание заказа через API, проверки перед подтверждением. Заметно больше тестов.

06

Железо для полностью локальной работы

Если вся цепочка должна работать у вас, её нужно обеспечить вычислениями. Варианты зависят от нагрузки и модели. Базовый ориентир для 20-30 одновременных разговоров - вариант 2, с него мы бы начали проверку.

Варианты железа для покупки

КонфигурацияРазговоров одновременно*Сервер целикомКогда подходит
1. Пилот: 1 × L40S 48 ГБ или 1 × RTX PRO 6000 96 ГБ5-10 / 10-20$20-35kПилот, один отдел, проверка гипотезы
2. База: 2 × L40S, 32 ядра, 256 ГБ, NVMe 2 ТБ20-30$35-50kРабочая нагрузка с компактной моделью на 7-14 млрд параметров
3. База с запасом: 2 × RTX PRO 6000 96 ГБ30-50$45-60kМодель покрупнее (30-70 млрд) или рост нагрузки в том же корпусе
4. Большой: 4 × L40S или 4 × H200 NVL50-100+$55-75k / $160-200kБольшая модель, 50+ звонков, несколько площадок на одном кластере
5. Бюджетно, б/у: A100 80 ГБ15-25 / 2 GPU$8-12k / GPUЖёсткий бюджет; без FP8, гарантия короткая или её нет

Аренда: 2 × L40S у провайдеров

ПровайдерЗа GPU в час2 GPU в месяцПримечание
Vast.ai≥ $0.54≈ $790Маркетплейс частных хостов, наличие плавает
Runpod$0.79 / $1.09≈ $1,150 / $1,590Community / Secure Cloud
Scaleway€1.47≈ €2,150Готовая конфигурация на 2 GPU, только Париж
Nebius≥ $1.55≈ $2,260Конфигурации собираются по vCPU
OVHcloud$1.80≈ $2,630Готовая конфигурация на 2 GPU, Европа
AWS (g6e)$1.86≈ $2,720Нет размера на 2 GPU: два инстанса по одной или один на 4 (≈ $7 660)
CoreWeave$2.25≈ $13,140Только узлы по 8 GPU
Immers.cloud—≈ 321 000 ₽ (2 × A100)Данные в РФ. L40S нет, ближайшее с открытой ценой - A100 80 ГБ
Selectel, Yandex Cloud, Cloud.ru, Timeweb, MTS Cloud——Данные в РФ. L40S публично не предлагают; RTX 6000 Ada, A6000, A100, H100 - цена по запросу
Lambda, Google Cloud, Azure, Hetzner——L40S нет; у Google, Azure и Hetzner вместо него RTX PRO 6000

* Число разговоров - допущение, а не замер: оно зависит от размера модели, распознавания и синтеза и проверяется нагрузочным тестом. Цены проверены 9 октября 2026 года, без НДС; железо и память дорожали весь 2026 год. В России цены на GPU в 1,5-2 раза выше и обычно под заказ, срок 40-60 рабочих дней.

Почему число звонков не определяет железо само по себе

  • Важно, как модели отвечают под нагрузкой, когда несколько человек одновременно договорили и ждут ответа.
  • Компактная разговорная модель и большая требуют разного железа при том же числе звонков.
  • Задержка критична: ответ через три секунды делает разговор неживым, даже если звонков немного.

Порядок, который экономит деньги

  1. 01Собираем связку на арендованном железе.
  2. 02Гоняем нагрузочные тесты с вашими сценариями и пиком звонков.
  3. 03Фиксируем требования к коробке по результатам.
  4. 04Только после этого покупаем оборудование.
07

Проверка на вашей линии

Голос, который чисто звучит в браузере, проходит через мобильную сеть со сжатием. Если звонок идёт через два мобильных плеча, звук деградирует дважды. Мы проверили это на модели линии: AMR-NB на каждом плече и G.711 между ними.

Голос агента
остаётся разборчивым даже на плохой сети: адрес, цена и телефон распознаются дословно
Голос звонящего
страдают короткие ответы: «сто на сто» превращается в «сто». Агент настроен переспрашивать странные ответы
Задержка
каждое плечо добавляет десятки миллисекунд, это закладываем в бюджет ответа

Модель линии - приближение. Окончательно качество проверяется звонками через вашу реальную цепочку, и это входит в приёмку.

Послушать в демо с режимом «Два плеча» →
08

Как принимаем результат

Критерии фиксируются до начала работ, чтобы «готово» значило одно и то же для обеих сторон.

Сценарии
Согласованный список разговоров проходит на вашей линии от начала до конца, включая трудные: возражения, перебивания, уход от темы.
Голос
Качество на реальной линии с вашей телефонией, а не в студии и не в браузере.
Скорость ответа
Медиана и 90-й процентиль задержки от конца фразы до голоса, под согласованной нагрузкой.
Перебивание
Агент замолкает, когда его перебивают, и не прерывается на «угу» и «ага».
Данные
Поля после звонка заполнены верно: имя, телефон, запрос, дата, итог - и лежат там, где вы с ними работаете.
09

Бюджет

Если мы берём на себя весь виртуальный колл-центр: Asterisk, телефонию, ИИ-оператора, интеграцию и запуск.

Первая рабочая версия
$25-40 тыс.
до 20-30 одновременных разговоров, согласованные сценарии и критерии приёмки
Сопровождение
$1,5-3 тыс. в месяц
поддержка, доработка сценариев, наблюдение за качеством
Железо или аренда
отдельно
для локального варианта, см. выше
Связь и лицензии
отдельно
SIP-транк, номера, облачные модели, если они используются

Это ориентир, а не прайс. Точную сумму называем после фиксации объёма: оператор, который квалифицирует и переводит, и оператор, который продаёт и оформляет заказ, стоят по-разному.

10

Почему железо попроще не подойдёт

Самые частые вопросы, когда смотрят на таблицу выше и хочется сэкономить. Коротко: для одного-двух звонков в тестовом режиме хватит многого. Для 20-30 одновременных разговоров с ответом за секунду - нет.

Почему не игровая видеокарта вроде RTX 4090 или 5090?+

У неё 24-32 ГБ памяти. В одну карту должны поместиться модель ответа, распознавание и синтез, и ещё память на каждый идущий разговор. На 20-30 параллельных звонков её не хватает, и ответы начинают ждать в очереди. Кроме того, лицензия драйверов NVIDIA запрещает ставить игровые карты GeForce в дата-центр, у них нет памяти с коррекцией ошибок (ECC), а охлаждение не рассчитано на работу 24/7 в серверной стойке. Для прототипа на один-два звонка такая карта годится, для продакшена - нет.

Почему нельзя всё запустить на процессорах, без GPU?+

Языковая модель на процессоре пишет ответ секундами на фразу. Распознавание и синтез в реальном времени для десятков потоков тоже упираются в процессор. Бюджет на ответ - около секунды, из которых на модель приходится полсекунды. На процессорах он не укладывается даже при одном звонке.

А одна небольшая GPU, например L4 на 24 ГБ или старая T4?+

Для пилота на несколько звонков - возможно, это вариант 1 из таблицы, только слабее. Проблема в пиках: когда пять человек договорили одновременно, их ответы встают в очередь, и вместо секунды получается три-пять. T4 к тому же не поддерживает современные форматы вычислений и заметно медленнее. Такую карту стоит брать, только если пиковая нагрузка - пара звонков.

А Mac Studio или мини-компьютер с большой памятью?+

Одну модель такой компьютер запускает неплохо, и для разработки это удобно. Но он рассчитан на один поток: десятки параллельных разговоров он обслуживает плохо, потому что не умеет эффективно объединять запросы в пакеты, как серверные GPU. Плюс нет серверного управления, резервирования и привычной эксплуатации в стойке.

Почему бы просто не взять модель поменьше, чтобы влезла в дешёвое железо?+

Маленькая модель влезет, но хуже держит сценарий: путает цены, уходит от темы, соглашается на скидки, которых нет, хуже говорит по-русски. Мы видели это на тестах даже между облачными моделями одного уровня: одна отвечала коротко и по правилам, другая той же скорости скатывалась в монологи. Размер модели - это компромисс между качеством разговора и железом, и проверять его нужно на ваших сценариях.

Почему железо считают под пик, а не под среднюю нагрузку?+

Звонки приходят пачками: утром, после рассылки, в обед. Задержка растёт не плавно, а резко, как только запросов становится больше, чем карта успевает обработать. Сервер, рассчитанный на среднюю нагрузку, в пике отвечает по три секунды, и именно в пике звонят больше всего людей.

Можно начать с дешёвого и потом докупить?+

Да, и это правильный путь. Сначала аренда и нагрузочные тесты, потом вариант 1 под пилот. Архитектура позволяет разнести распознавание, синтез и модель ответа по разным серверам, так что расширение - это добавление железа, а не переделка системы.

С чего начать

Сначала послушайте агента. Если такой порядок бюджета подходит, следующий шаг - описать первую поставку и зафиксировать, что должно работать при приёмке.

Сколько стоит: от 7 900 ₽ в месяц · Какие исходящие звонки делает агент?

Позвонить в демоОбсудить поставку

Ассистенты, которые отвечают вашим клиентам поверх тех систем, которые у вас уже работают. Сама услуга автоматизации живёт на inite.ai.

Email[email protected]
OfficeУдаленная работа по всему миру

Экосистема INITE

  • INITE AI
  • INITE Education
  • INITE Club
  • INITE Events
  • INITE Fund
  • INITE Digital
  • INITE Rent
  • INITE Estate
  • INITE Shop
  • INITE Studio
  • INITE Health
  • INITE Travel
  • INITE Sport

Компания

  • О нас
  • Продукты
  • Полевые заметки
  • Запустить аудит
  • Какие модели и как
  • Как мы обращаемся с ИИ

Проекты и решения

  • Voice AI
  • Sales AI
  • Social AI
  • Omni AI

Автоматизация в INITE

Продаётся и делается на inite.ai

  • Услуги
  • Методология
  • Тарифы
  • Кейсы
  • Ресурсы

© 2025 INITE SOLUTIONS. Все права защищены.

Политика конфиденциальностиУсловия и положенияПолитика cookiesЗащита данных
LanguagesEnglish/Русский/Español/Português