Самые частые вопросы, когда смотрят на таблицу выше и хочется сэкономить. Коротко: для одного-двух звонков в тестовом режиме хватит многого. Для 20-30 одновременных разговоров с ответом за секунду - нет.
Почему не игровая видеокарта вроде RTX 4090 или 5090?+
У неё 24-32 ГБ памяти. В одну карту должны поместиться модель ответа, распознавание и синтез, и ещё память на каждый идущий разговор. На 20-30 параллельных звонков её не хватает, и ответы начинают ждать в очереди. Кроме того, лицензия драйверов NVIDIA запрещает ставить игровые карты GeForce в дата-центр, у них нет памяти с коррекцией ошибок (ECC), а охлаждение не рассчитано на работу 24/7 в серверной стойке. Для прототипа на один-два звонка такая карта годится, для продакшена - нет.
Почему нельзя всё запустить на процессорах, без GPU?+
Языковая модель на процессоре пишет ответ секундами на фразу. Распознавание и синтез в реальном времени для десятков потоков тоже упираются в процессор. Бюджет на ответ - около секунды, из которых на модель приходится полсекунды. На процессорах он не укладывается даже при одном звонке.
А одна небольшая GPU, например L4 на 24 ГБ или старая T4?+
Для пилота на несколько звонков - возможно, это вариант 1 из таблицы, только слабее. Проблема в пиках: когда пять человек договорили одновременно, их ответы встают в очередь, и вместо секунды получается три-пять. T4 к тому же не поддерживает современные форматы вычислений и заметно медленнее. Такую карту стоит брать, только если пиковая нагрузка - пара звонков.
А Mac Studio или мини-компьютер с большой памятью?+
Одну модель такой компьютер запускает неплохо, и для разработки это удобно. Но он рассчитан на один поток: десятки параллельных разговоров он обслуживает плохо, потому что не умеет эффективно объединять запросы в пакеты, как серверные GPU. Плюс нет серверного управления, резервирования и привычной эксплуатации в стойке.
Почему бы просто не взять модель поменьше, чтобы влезла в дешёвое железо?+
Маленькая модель влезет, но хуже держит сценарий: путает цены, уходит от темы, соглашается на скидки, которых нет, хуже говорит по-русски. Мы видели это на тестах даже между облачными моделями одного уровня: одна отвечала коротко и по правилам, другая той же скорости скатывалась в монологи. Размер модели - это компромисс между качеством разговора и железом, и проверять его нужно на ваших сценариях.
Почему железо считают под пик, а не под среднюю нагрузку?+
Звонки приходят пачками: утром, после рассылки, в обед. Задержка растёт не плавно, а резко, как только запросов становится больше, чем карта успевает обработать. Сервер, рассчитанный на среднюю нагрузку, в пике отвечает по три секунды, и именно в пике звонят больше всего людей.
Можно начать с дешёвого и потом докупить?+
Да, и это правильный путь. Сначала аренда и нагрузочные тесты, потом вариант 1 под пилот. Архитектура позволяет разнести распознавание, синтез и модель ответа по разным серверам, так что расширение - это добавление железа, а не переделка системы.