Las preguntas que surgen al mirar la tabla de arriba con ganas de ahorrar. En resumen: una o dos llamadas de prueba funcionan casi en cualquier cosa. Veinte o treinta conversaciones simultáneas respondidas en un segundo, no.
¿Por qué no una tarjeta gráfica de juegos, como una RTX 4090 o 5090?+
Tiene 24-32 GB de memoria. En una tarjeta tienen que caber el modelo de respuesta, el reconocimiento y la síntesis, más memoria para cada conversación en curso. Para 20-30 llamadas en paralelo no alcanza y las respuestas hacen cola. Además, la licencia de los drivers de NVIDIA prohíbe usar GeForce en centros de datos, no tienen memoria con corrección de errores (ECC) y su refrigeración no está pensada para 24/7 en un rack. Sirve para un prototipo de una o dos llamadas, no para producción.
¿Por qué no ejecutarlo todo en CPU, sin GPU?+
Un modelo de lenguaje en CPU tarda segundos por frase. El reconocimiento y la síntesis en tiempo real para decenas de flujos también chocan con la CPU. El presupuesto de respuesta es de un segundo, la mitad para el modelo. Con CPU no se cumple ni con una sola llamada.
¿Y una GPU pequeña, como una L4 de 24 GB o una T4 antigua?+
Para un piloto con pocas llamadas, quizá: es la opción 1 de la tabla, pero más débil. El problema son los picos: cuando cinco personas terminan de hablar a la vez, sus respuestas hacen cola y un segundo se convierte en tres a cinco. La T4 además no soporta formatos de cálculo modernos y es bastante más lenta. Solo compensa si el pico es de un par de llamadas.
¿Y un Mac Studio o un mini PC con mucha memoria?+
Ejecuta bien un solo modelo y es cómodo para desarrollar. Pero está hecho para un flujo: atiende mal decenas de conversaciones en paralelo, porque no agrupa peticiones como las GPU de servidor. Y no hay gestión de servidor, redundancia ni operación normal en rack.
¿Por qué no elegir un modelo más pequeño que quepa en hardware más barato?+
Un modelo pequeño cabe, pero sigue peor el guion: confunde precios, se va del tema, acepta descuentos que no existen y maneja peor los idiomas. Lo vimos en pruebas incluso entre modelos en la nube del mismo nivel: uno respondía breve y según las reglas, otro igual de rápido se iba en monólogos. El tamaño del modelo es un compromiso entre calidad de conversación y hardware, y hay que probarlo con sus escenarios.
¿Por qué dimensionar el hardware para el pico y no para la media?+
Las llamadas llegan en oleadas: por la mañana, tras un envío, a mediodía. La latencia no sube poco a poco: salta en cuanto las peticiones superan lo que la tarjeta procesa. Un servidor pensado para la media responde en tres segundos en el pico, justo cuando más gente llama.
¿Se puede empezar barato y ampliar después?+
Sí, y es el camino correcto. Primero alquiler y pruebas de carga, luego la opción 1 para un piloto. La arquitectura permite repartir reconocimiento, síntesis y modelo de respuesta en servidores distintos, así que crecer es añadir hardware, no rehacer el sistema.