Auditoria de encaixeNotas de campoSobre
00Como entregamos o Voice AI

Um operador de voz na nuvem ou dentro do seu perímetro

A demo mostra como o agente soa. Esta página é sobre o que está por trás da ligação: do que o operador é feito, as formas de entrega, o que precisa ser decidido antes de um preço e quanto custa cada parte.

01

Do que um operador de voz é feito

Não existe um «modelo de operador» que se entregue como um arquivo. É uma cadeia de peças, e cada uma funciona em tempo real.

  1. 01Telefonia

    Recebe a ligação e leva o áudio nos dois sentidos: um tronco SIP, Asterisk ou o seu PABX.

    Uma ligação para o seu número chega pela operadora e entra no Asterisk, que envia o áudio ao agente.

  2. 02Reconhecimento de fala

    Transforma a voz de quem liga em texto enquanto a pessoa ainda fala.

    «Oi, tenho percevejos num apartamento de dois quartos» já é texto antes de a frase terminar.

  3. 03Modelo de resposta

    Um modelo de linguagem decide o que dizer, a partir do roteiro, dos seus preços e das suas regras.

    Conhece a tabela, faz uma pergunta por vez, não oferece descontos que não existem e volta ao agendamento.

  4. 04Síntese de voz

    Fala a resposta com a voz do operador, com pausas, respirações e entonação.

    As primeiras palavras começam a tocar enquanto o modelo ainda escreve o fim da frase.

  5. 05Integrações

    Grava o resultado onde a sua equipe trabalha: CRM, agenda, planilha, mensageiro.

    Depois da ligação aparece um registro no CRM: nome, telefone, pedido, data da visita, preço informado, resultado.

Sobre a cadeia fica o controle da conversa: saber que a pessoa terminou, não parar num «uhum», calar quando interrompido, preencher a pausa se a resposta demora. A demo tem tudo isso ajustado, e é o que separa uma conversa de uma secretária eletrônica.

02

Para onde vai o segundo

As pessoas esperam resposta cerca de um segundo depois de pausar. Assim esse segundo se dividiu numa ligação real para a nossa demo.

do fim da frase à voz1,09 s
Perceber que você terminou, e rede
0,48
Modelo: primeira frase da resposta
0,54
Síntese: primeiro som
0,07
você terminao agente fala

Medido numa ligação de demonstração em 9 de outubro de 2026, modelos na nuvem. Para uma instalação local, essa divisão precisa ser medida de novo com os seus modelos e o seu hardware: é ela que decide se a conversa parece viva.

03

Três formas de entrega

A pergunta «nuvem ou próprio» decide quase todo o resto: prazo, orçamento, hardware e o quanto a voz vai se parecer com a demo.

Nuvem

Como na demo: modelos nos provedores, você paga por minuto de conversa.

Onde os modelos rodam
Nos provedores de voz e de modelos de linguagem
Onde ficam dados e gravações
No provedor, com retenção configurável
Voz e latência
Como na demo
Hardware
Não precisa
Prazo até a primeira versão
O mais rápido

Quando velocidade de lançamento e qualidade de voz importam, e manter gravações num provedor é aceitável.

Seu perímetro + modelos na nuvem

Telefonia, controle da conversa, integrações e dados ficam com você; os modelos são chamados por API.

Onde os modelos rodam
Nos provedores, por API
Onde ficam dados e gravações
Com você; sai só o necessário para a resposta
Voz e latência
Como na demo
Hardware
Um servidor comum, sem GPU
Prazo até a primeira versão
Intermediário

Quando os dados precisam ficar com você, mas chamar modelos externos de dentro do perímetro é permitido.

Totalmente local

A cadeia inteira nos seus servidores, sem nada saindo.

Onde os modelos rodam
Nos seus servidores
Onde ficam dados e gravações
Só com você
Voz e latência
Testado de novo: depende dos modelos locais
Hardware
Servidores com GPU
Prazo até a primeira versão
O mais longo: escolha de modelos e testes de carga

Quando nada pode sair, e há orçamento para o hardware e tempo para os testes.

04

O que precisa ser decidido antes de um preço

Preço e prazo vêm depois da especificação. Sem ela, mil e um desejos aparecem no caminho. Estas são as perguntas que precisam de resposta, com exemplos.

  1. 01

    Onde roda?

    Decide a forma de entrega, o hardware e metade do orçamento.

    «Tudo nos nossos servidores, nada sai» ou «conosco, mas modelos na nuvem por API podem».

  2. 02

    Só voz ou uma conversa completa?

    Ler um texto pronto e um operador que escuta, entende e conduz a conversa são sistemas de tamanhos muito diferentes.

    «Ler o status de um pedido pelo número» ou «receber um pedido e responder perguntas».

  3. 03

    O que o operador faz?

    Cada cenário é um prompt, conhecimento, verificações e testes. Sem exemplos não dá para dimensionar.

    «Receber um pedido de dedetização, dar o preço da tabela, agendar e passar para uma pessoa se o cliente discutir».

  4. 04

    Quantas ligações simultâneas?

    O pico de carga decide o hardware, ou a conta da nuvem.

    «Até 10 num dia normal, 30 no pico, 1-2 à noite».

  5. 05

    Com o que conectamos?

    O limite do trabalho: o que vocês conectam e o que nós construímos.

    «Temos Asterisk e entregamos um tronco SIP; a integração com o CRM fazemos nós pela sua API».

  6. 06

    Que hardware existe?

    Para o local: ajustamos os modelos ao seu hardware, ou o hardware à qualidade necessária.

    «Um rack num data center, sem GPU, orçamento de compra a combinar».

  7. 07

    Como o resultado é aceito?

    Sem critérios de aceite, cada mudança vira discussão.

    «Dez cenários combinados passam na nossa linha real, resposta mediana de até 1,5 segundo, a interrupção funciona».

05

Operadores diferentes, trabalho diferente

A palavra «operador» esconde quantidades de trabalho muito diferentes. Dois exemplos na mesma linha.

Qualifica e transfere

Descobre quem liga e por quê, responde perguntas comuns, agenda ou passa para uma pessoa com o contexto já reunido.

AgenteLarLimpo Dedetização, em que posso ajudar?

ClienteEstamos com baratas, quanto custa?

AgenteEntendi. É apartamento? Quantos quartos?

ClienteDois.

AgentePara dois quartos fica trezentos e quarenta reais. Posso agendar para amanhã?

Um ou dois cenários, a tabela de preços, regras de transferência. Integração: um registro no CRM.

Vende e registra o pedido

Trata objeções, oferece alternativas, verifica estoque e horários, registra o pedido nos seus sistemas e confirma.

ClienteEstá caro. Outros cobram menos.

AgenteEntendo. Tem garantia de um ano e a segunda visita é grátis. Se for pouca coisa, existe uma opção mais barata.

ClienteTá bom, sábado então.

AgenteDeixa eu ver os técnicos... sábado, onze da manhã está livre. Já registro.

Roteiros de objeções, acesso em tempo real a agendas e estoque, criação de pedidos por API, verificações antes de confirmar. Bem mais testes.

06

Hardware para rodar totalmente local

Se a cadeia inteira precisa rodar com você, ela precisa de capacidade de cálculo. As opções dependem da carga e do modelo. A referência para 20-30 conversas simultâneas é a opção 2, a partir da qual começaríamos os testes.

Opções de hardware para comprar

ConfiguraçãoLigações simultâneas*Servidor completoQuando serve
1. Piloto: 1 × L40S 48 GB ou 1 × RTX PRO 6000 96 GB5-10 / 10-20$20-35kUm piloto, um departamento, uma prova de conceito
2. Base: 2 × L40S, 32 núcleos, 256 GB, NVMe 2 TB20-30$35-50kProdução com um modelo compacto de 7-14 bilhões de parâmetros
3. Base com folga: 2 × RTX PRO 6000 96 GB30-50$45-60kUm modelo maior (30-70 bilhões) ou folga para crescer na mesma caixa
4. Grande: 4 × L40S ou 4 × H200 NVL50-100+$55-75k / $160-200kUm modelo grande, mais de 50 ligações, várias unidades num cluster
5. Econômico, usado: A100 80 GB15-25 / 2 GPU$8-12k / GPUOrçamento apertado; sem FP8, garantia curta ou nenhuma

Aluguel: 2 × L40S por provedor

ProvedorPor GPU-hora2 GPUs por mêsObservação
Vast.ai≥ $0.54≈ $790Marketplace de hosts da comunidade, a disponibilidade varia
Runpod$0.79 / $1.09≈ $1,150 / $1,590Community / Secure Cloud
Scaleway€1.47≈ €2,150Configuração pronta de 2 GPUs, só Paris
Nebius≥ $1.55≈ $2,260Configurações dimensionadas por vCPU
OVHcloud$1.80≈ $2,630Configuração pronta de 2 GPUs, Europa
AWS (g6e)$1.86≈ $2,720Sem tamanho de 2 GPUs: duas instâncias de 1 ou uma de 4 (≈ US$ 7.660)
CoreWeave$2.25≈ $13,140Só nós de 8 GPUs
Immers.cloud—≈ 321 000 ₽ (2 × A100)Dados na Rússia. Sem L40S; o mais próximo com preço público é A100 80 GB
Selectel, Yandex Cloud, Cloud.ru, Timeweb, MTS Cloud——Dados na Rússia. Sem L40S público; RTX 6000 Ada, A6000, A100, H100 sob consulta
Lambda, Google Cloud, Azure, Hetzner——Sem L40S; Google, Azure e Hetzner oferecem RTX PRO 6000

* O número de ligações é uma suposição, não uma medição: depende do tamanho do modelo, do reconhecimento e da síntese, e é fixado num teste de carga. Preços consultados em 9 de outubro de 2026, sem impostos; hardware e memória ficaram mais caros ao longo de 2026.

Por que o número de ligações sozinho não dimensiona o hardware

  • O que importa é como os modelos respondem sob carga, quando várias pessoas terminam a frase ao mesmo tempo e esperam.
  • Um modelo conversacional compacto e um grande precisam de hardware diferente para o mesmo número de ligações.
  • A latência é crítica: uma resposta em três segundos mata a conversa, mesmo com poucas ligações.

A ordem que economiza dinheiro

  1. 01Montar a cadeia em hardware alugado.
  2. 02Rodar testes de carga com os seus cenários e o seu pico de ligações.
  3. 03Fixar os requisitos da caixa a partir dos resultados.
  4. 04Só então comprar o equipamento.
07

Teste na sua linha

Uma voz que soa limpa no navegador atravessa uma rede móvel com compressão. Se a ligação passa por dois trechos móveis, o áudio degrada duas vezes. Testamos isso num modelo da linha: AMR-NB em cada trecho e G.711 entre eles.

A voz do agente
continua inteligível mesmo com sinal ruim: endereço, preço e telefone chegam palavra por palavra
A voz de quem liga
sofrem as respostas curtas: «cem por cem» vira «cem». O agente pergunta de novo quando algo soa estranho
Latência
cada trecho soma dezenas de milissegundos; isso entra no orçamento da resposta

Um modelo de linha é uma aproximação. A qualidade é decidida com ligações pela sua cadeia real, e isso faz parte do aceite.

Ouvir na demo com «Dois trechos» →
08

Como o resultado é aceito

Os critérios são fixados antes de começar, para que «pronto» signifique o mesmo para os dois lados.

Cenários
Uma lista combinada de conversas passa na sua linha do começo ao fim, incluindo as difíceis: objeções, interrupções, mudança de assunto.
Voz
Qualidade na linha real com a sua telefonia, não num estúdio nem no navegador.
Velocidade de resposta
Mediana e percentil 90 do fim da frase até a voz, sob a carga combinada.
Interrupção
O agente se cala quando interrompido e não para por um «uhum».
Dados
Os campos depois da ligação estão certos - nome, telefone, pedido, data, resultado - e chegam onde vocês trabalham.
09

Orçamento

Se assumimos todo o call center virtual: Asterisk, telefonia, o operador com IA, a integração e o lançamento.

Primeira versão funcionando
US$ 25-40 mil
até 20-30 conversas simultâneas, cenários e critérios de aceite combinados
Suporte contínuo
US$ 1,5-3 mil por mês
suporte, ajustes de cenários, acompanhamento de qualidade
Hardware ou aluguel
à parte
para a opção local, veja acima
Conectividade e licenças
à parte
tronco SIP, números, modelos na nuvem quando usados

É uma ordem de grandeza, não uma tabela de preços. O valor exato vem quando o escopo é fixado: um operador que qualifica e transfere e um que vende e registra pedidos custam diferente.

10

Por que um hardware mais simples não serve

As perguntas que aparecem ao olhar a tabela acima com vontade de economizar. Em resumo: uma ou duas ligações de teste rodam em quase tudo. Vinte ou trinta conversas simultâneas respondidas em um segundo, não.

Por que não uma placa de vídeo gamer, como uma RTX 4090 ou 5090?+

Ela tem 24-32 GB de memória. Numa placa precisam caber o modelo de resposta, o reconhecimento e a síntese, além de memória para cada conversa em andamento. Para 20-30 ligações em paralelo não basta, e as respostas entram em fila. Além disso, a licença dos drivers da NVIDIA proíbe placas GeForce em data centers, elas não têm memória com correção de erros (ECC) e a refrigeração não foi feita para 24/7 num rack. Serve para um protótipo de uma ou duas ligações, não para produção.

Por que não rodar tudo em CPU, sem GPU?+

Um modelo de linguagem em CPU leva segundos por frase. Reconhecimento e síntese em tempo real para dezenas de fluxos também esbarram na CPU. O orçamento de resposta é de cerca de um segundo, metade para o modelo. Em CPU isso não fecha nem com uma ligação.

E uma GPU pequena, como uma L4 de 24 GB ou uma T4 antiga?+

Para um piloto com poucas ligações, talvez: é a opção 1 da tabela, só que mais fraca. O problema são os picos: quando cinco pessoas terminam de falar ao mesmo tempo, as respostas entram em fila e um segundo vira três a cinco. A T4 ainda não suporta formatos de cálculo modernos e é bem mais lenta. Só compensa se o pico for de umas duas ligações.

E um Mac Studio ou um mini PC com muita memória?+

Ele roda bem um modelo só e é prático para desenvolvimento. Mas foi feito para um fluxo: atende mal dezenas de conversas em paralelo, porque não agrupa requisições como as GPUs de servidor. E não há gestão de servidor, redundância nem operação normal em rack.

Por que não escolher um modelo menor que caiba num hardware mais barato?+

Um modelo pequeno cabe, mas segue pior o roteiro: confunde preços, foge do assunto, aceita descontos que não existem e lida pior com idiomas. Vimos isso em testes até entre modelos na nuvem do mesmo nível: um respondia curto e dentro das regras, outro igualmente rápido caía em monólogos. O tamanho do modelo é um equilíbrio entre qualidade da conversa e hardware, e precisa ser testado nos seus cenários.

Por que dimensionar o hardware pelo pico e não pela média?+

As ligações chegam em ondas: de manhã, depois de um disparo, no almoço. A latência não sobe aos poucos: ela salta assim que as requisições passam do que a placa processa. Um servidor dimensionado pela média responde em três segundos no pico, justamente quando mais gente liga.

Dá para começar barato e ampliar depois?+

Sim, e é o caminho certo. Primeiro aluguel e testes de carga, depois a opção 1 para um piloto. A arquitetura permite separar reconhecimento, síntese e modelo de resposta em servidores diferentes, então crescer é adicionar hardware, não refazer o sistema.

Por onde começar

Ouça o agente primeiro. Se essa ordem de orçamento funciona para você, o próximo passo é descrever a primeira entrega e fixar o que precisa funcionar no aceite.

Quanto custa: a partir de $99 por mês · Que ligações ativas o agente faz?

Ligar para a demoConversar sobre uma entrega

Assistentes que respondem aos seus clientes por cima dos sistemas que você já usa. O serviço de automação em si vive no inite.ai.

Email[email protected]
OfficeOperações Remotas Globais

Ecossistema INITE

  • INITE AI
  • INITE Education
  • INITE Club
  • INITE Events
  • INITE Fund
  • INITE Digital
  • INITE Rent
  • INITE Estate
  • INITE Shop
  • INITE Studio
  • INITE Health
  • INITE Travel
  • INITE Sport

Empresa

  • Sobre
  • Produtos
  • Notas de campo
  • Auditoria de encaixe
  • Quais modelos e como
  • Como tratamos a IA

Projetos e Soluções

  • Voice AI
  • Sales AI
  • Social AI
  • Omni AI

Automação com a INITE

Vendido e entregue no inite.ai

  • Serviços
  • Metodologia
  • Níveis de Serviço
  • Estudos de Caso
  • Recursos

© 2025 INITE SOLUTIONS. Todos os direitos reservados.

Política de PrivacidadeTermos e CondiçõesPolítica de CookiesProteção de Dados
LanguagesEnglish/Русский/Español/Português