As perguntas que aparecem ao olhar a tabela acima com vontade de economizar. Em resumo: uma ou duas ligações de teste rodam em quase tudo. Vinte ou trinta conversas simultâneas respondidas em um segundo, não.
Por que não uma placa de vídeo gamer, como uma RTX 4090 ou 5090?+
Ela tem 24-32 GB de memória. Numa placa precisam caber o modelo de resposta, o reconhecimento e a síntese, além de memória para cada conversa em andamento. Para 20-30 ligações em paralelo não basta, e as respostas entram em fila. Além disso, a licença dos drivers da NVIDIA proíbe placas GeForce em data centers, elas não têm memória com correção de erros (ECC) e a refrigeração não foi feita para 24/7 num rack. Serve para um protótipo de uma ou duas ligações, não para produção.
Por que não rodar tudo em CPU, sem GPU?+
Um modelo de linguagem em CPU leva segundos por frase. Reconhecimento e síntese em tempo real para dezenas de fluxos também esbarram na CPU. O orçamento de resposta é de cerca de um segundo, metade para o modelo. Em CPU isso não fecha nem com uma ligação.
E uma GPU pequena, como uma L4 de 24 GB ou uma T4 antiga?+
Para um piloto com poucas ligações, talvez: é a opção 1 da tabela, só que mais fraca. O problema são os picos: quando cinco pessoas terminam de falar ao mesmo tempo, as respostas entram em fila e um segundo vira três a cinco. A T4 ainda não suporta formatos de cálculo modernos e é bem mais lenta. Só compensa se o pico for de umas duas ligações.
E um Mac Studio ou um mini PC com muita memória?+
Ele roda bem um modelo só e é prático para desenvolvimento. Mas foi feito para um fluxo: atende mal dezenas de conversas em paralelo, porque não agrupa requisições como as GPUs de servidor. E não há gestão de servidor, redundância nem operação normal em rack.
Por que não escolher um modelo menor que caiba num hardware mais barato?+
Um modelo pequeno cabe, mas segue pior o roteiro: confunde preços, foge do assunto, aceita descontos que não existem e lida pior com idiomas. Vimos isso em testes até entre modelos na nuvem do mesmo nível: um respondia curto e dentro das regras, outro igualmente rápido caía em monólogos. O tamanho do modelo é um equilíbrio entre qualidade da conversa e hardware, e precisa ser testado nos seus cenários.
Por que dimensionar o hardware pelo pico e não pela média?+
As ligações chegam em ondas: de manhã, depois de um disparo, no almoço. A latência não sobe aos poucos: ela salta assim que as requisições passam do que a placa processa. Um servidor dimensionado pela média responde em três segundos no pico, justamente quando mais gente liga.
Dá para começar barato e ampliar depois?+
Sim, e é o caminho certo. Primeiro aluguel e testes de carga, depois a opção 1 para um piloto. A arquitetura permite separar reconhecimento, síntese e modelo de resposta em servidores diferentes, então crescer é adicionar hardware, não refazer o sistema.