Auditoría de encajeNotas de campoSobre nosotros
00Cómo entregamos Voice AI

Un operador de voz en la nube o dentro de su perímetro

La demo muestra cómo suena el agente. Esta página trata de lo que hay detrás de la llamada: de qué está hecho el operador, las formas de entregarlo, qué hay que decidir antes de un precio y cuánto cuesta cada parte.

01

De qué está hecho un operador de voz

No existe un «modelo de operador» que se pueda entregar como un archivo. Es una cadena de piezas, y cada una funciona en tiempo real.

  1. 01Telefonía

    Recibe la llamada y lleva el audio en ambos sentidos: un troncal SIP, Asterisk o su centralita.

    Una llamada a su número llega por el operador y entra en Asterisk, que envía el audio al agente.

  2. 02Reconocimiento de voz

    Convierte la voz de quien llama en texto mientras todavía habla.

    «Hola, tengo chinches en un piso de dos dormitorios» es texto antes de que termine la frase.

  3. 03Modelo de respuesta

    Un modelo de lenguaje decide qué decir, según el guion, sus precios y sus reglas.

    Conoce la tarifa, hace una pregunta cada vez, no ofrece descuentos que no existen y vuelve a la cita.

  4. 04Síntesis de voz

    Dice la respuesta con la voz del operador, con pausas, respiraciones y entonación.

    Las primeras palabras empiezan a sonar mientras el modelo aún escribe el final de la frase.

  5. 05Integraciones

    Escribe el resultado donde su equipo trabaja: CRM, calendario, hoja de cálculo, mensajería.

    Tras la llamada aparece un registro en el CRM: nombre, teléfono, solicitud, fecha de visita, precio indicado, resultado.

Sobre la cadena está el control de la conversación: saber que quien llama ha terminado, no pararse por un «ajá», callarse cuando le interrumpen, llenar la pausa si la respuesta tarda. La demo lo tiene todo ajustado, y es lo que separa una conversación de un contestador.

02

A dónde va el segundo

La gente espera respuesta alrededor de un segundo después de hacer una pausa. Así se repartió ese segundo en una llamada real a nuestra demo.

del fin de la frase a la voz1,09 s
Detectar que ha terminado, y red
0,48
Modelo: primera frase de la respuesta
0,54
Síntesis: primer sonido
0,07
usted terminael agente habla

Medido en una llamada de demostración el 9 de octubre de 2026, con modelos en la nube. Para una instalación local hay que medirlo de nuevo con sus modelos y su hardware: es lo que decide si la conversación parece viva.

03

Tres formas de entregarlo

La pregunta «nube o propio» decide casi todo lo demás: plazo, presupuesto, hardware y cuánto se parecerá la voz a la demo.

Nube

Como en la demo: modelos en los proveedores, paga por minuto de conversación.

Dónde funcionan los modelos
En los proveedores de voz y de modelos de lenguaje
Dónde están los datos y grabaciones
En el proveedor, con retención configurable
Voz y latencia
Como en la demo
Hardware
No hace falta
Plazo hasta la primera versión
El más rápido

Cuando importan la rapidez de lanzamiento y la calidad de la voz, y guardar grabaciones en un proveedor es aceptable.

Su perímetro + modelos en la nube

Telefonía, control de la conversación, integraciones y datos quedan en su casa; los modelos se llaman por API.

Dónde funcionan los modelos
En los proveedores, por API
Dónde están los datos y grabaciones
En su casa; solo sale lo necesario para la respuesta
Voz y latencia
Como en la demo
Hardware
Un servidor normal, sin GPU
Plazo hasta la primera versión
Intermedio

Cuando los datos deben quedarse con usted, pero llamar a modelos externos desde el perímetro está permitido.

Totalmente local

Toda la cadena en sus servidores, sin que salga nada.

Dónde funcionan los modelos
En sus servidores
Dónde están los datos y grabaciones
Solo en su casa
Voz y latencia
Se vuelve a probar: depende de los modelos locales
Hardware
Servidores con GPU
Plazo hasta la primera versión
El más largo: selección de modelos y pruebas de carga

Cuando no puede salir nada, y hay presupuesto para el hardware y tiempo para las pruebas.

04

Qué hay que decidir antes de un precio

El precio y el plazo llegan después de la especificación. Sin ella aparecen mil y un deseos por el camino. Estas son las preguntas que necesitan respuesta, con ejemplos.

  1. 01

    ¿Dónde funciona?

    Decide la forma de entrega, el hardware y la mitad del presupuesto.

    «Todo en nuestros servidores, no sale nada» o «en casa, pero los modelos en la nube por API valen».

  2. 02

    ¿Solo voz o una conversación completa?

    Leer un texto dado y un operador que escucha, entiende y lleva la conversación son sistemas de tamaño muy distinto.

    «Leer el estado de un pedido por su número» o «tomar una solicitud y responder preguntas».

  3. 03

    ¿Qué hace el operador?

    Cada escenario es un prompt, conocimiento, comprobaciones y pruebas. Sin ejemplos no se puede dimensionar.

    «Tomar una solicitud de control de plagas, dar el precio de la tarifa, dar cita y pasar a una persona si el cliente discute».

  4. 04

    ¿Cuántas llamadas simultáneas?

    La carga en el pico decide el hardware o la factura de la nube.

    «Hasta 10 en un día normal, 30 en el pico, 1-2 de noche».

  5. 05

    ¿Con qué lo conectamos?

    El límite del trabajo: qué conectan ustedes y qué construimos nosotros.

    «Tenemos Asterisk y les damos un troncal SIP; la integración con el CRM la hacemos nosotros con su API».

  6. 06

    ¿Qué hardware hay?

    Para lo local: ajustamos los modelos a su hardware, o el hardware a la calidad que necesita.

    «Un rack en un centro de datos, sin GPU, presupuesto de compra por acordar».

  7. 07

    ¿Cómo se acepta el resultado?

    Sin criterios de aceptación cada cambio se vuelve una discusión.

    «Diez escenarios acordados pasan en nuestra línea real, respuesta mediana de no más de 1,5 segundos, la interrupción funciona».

05

Operadores distintos, trabajo distinto

La palabra «operador» esconde cantidades de trabajo muy distintas. Dos ejemplos en la misma línea.

Cualifica y transfiere

Averigua quién llama y para qué, responde preguntas habituales, da cita o pasa a una persona con el contexto ya recogido.

AgenteCasaLimpia Control de Plagas, ¿en qué puedo ayudarle?

ClienteTenemos cucarachas, ¿cuánto cuesta?

AgenteEntendido. ¿Es un piso? ¿Cuántos dormitorios?

ClienteDos.

AgentePara dos dormitorios son ciento veinte euros. ¿Le doy cita para mañana?

Uno o dos escenarios, la tarifa, reglas de transferencia. Integración: un registro en el CRM.

Vende y tramita el pedido

Maneja objeciones, ofrece alternativas, comprueba disponibilidad y huecos, tramita el pedido en sus sistemas y lo confirma.

ClienteEs caro. Otros cobran menos.

AgenteLo entiendo. Tiene garantía de un año y la segunda visita es gratis. Si hay pocas, existe una opción más barata.

ClienteVale, el sábado.

AgenteA ver los técnicos... sábado a las once está libre. Lo tramito.

Guiones de objeciones, acceso en vivo a agendas y existencias, creación de pedidos por API, comprobaciones antes de confirmar. Bastantes más pruebas.

06

Hardware para funcionar totalmente en local

Si toda la cadena debe funcionar en su casa, necesita capacidad de cálculo. Las opciones dependen de la carga y del modelo. La referencia para 20-30 conversaciones simultáneas es la opción 2, desde la que empezaríamos a probar.

Opciones de hardware para comprar

ConfiguraciónLlamadas simultáneas*Servidor completoCuándo encaja
1. Piloto: 1 × L40S 48 GB o 1 × RTX PRO 6000 96 GB5-10 / 10-20$20-35kUn piloto, un departamento, una prueba de concepto
2. Base: 2 × L40S, 32 núcleos, 256 GB, NVMe 2 TB20-30$35-50kProducción con un modelo compacto de 7-14 mil millones de parámetros
3. Base con margen: 2 × RTX PRO 6000 96 GB30-50$45-60kUn modelo mayor (30-70 mil millones) o margen para crecer en la misma caja
4. Grande: 4 × L40S o 4 × H200 NVL50-100+$55-75k / $160-200kUn modelo grande, más de 50 llamadas, varias sedes en un clúster
5. Económico, usado: A100 80 GB15-25 / 2 GPU$8-12k / GPUPresupuesto ajustado; sin FP8, garantía corta o ninguna

Alquiler: 2 × L40S por proveedor

ProveedorPor GPU y hora2 GPU al mesNota
Vast.ai≥ $0.54≈ $790Marketplace de hosts particulares, la disponibilidad varía
Runpod$0.79 / $1.09≈ $1,150 / $1,590Community / Secure Cloud
Scaleway€1.47≈ €2,150Configuración de 2 GPU, solo París
Nebius≥ $1.55≈ $2,260Configuraciones por vCPU
OVHcloud$1.80≈ $2,630Configuración de 2 GPU, Europa
AWS (g6e)$1.86≈ $2,720Sin tamaño de 2 GPU: dos instancias de 1 o una de 4 (≈ 7.660 $)
CoreWeave$2.25≈ $13,140Solo nodos de 8 GPU
Immers.cloud—≈ 321 000 ₽ (2 × A100)Datos en Rusia. Sin L40S; lo más cercano con precio público es A100 80 GB
Selectel, Yandex Cloud, Cloud.ru, Timeweb, MTS Cloud——Datos en Rusia. Sin L40S público; RTX 6000 Ada, A6000, A100, H100 bajo pedido
Lambda, Google Cloud, Azure, Hetzner——Sin L40S; Google, Azure y Hetzner ofrecen RTX PRO 6000

* El número de llamadas es una suposición, no una medida: depende del tamaño del modelo, del reconocimiento y de la síntesis, y se fija con una prueba de carga. Precios consultados el 9 de octubre de 2026, sin IVA; el hardware y la memoria se encarecieron durante todo 2026.

Por qué el número de llamadas no dimensiona el hardware por sí solo

  • Lo que importa es cómo responden los modelos bajo carga, cuando varias personas terminan la frase a la vez y esperan.
  • Un modelo conversacional compacto y uno grande necesitan hardware distinto para el mismo número de llamadas.
  • La latencia es crítica: una respuesta a los tres segundos mata la conversación, aunque haya pocas llamadas.

El orden que ahorra dinero

  1. 01Montar la cadena en hardware alquilado.
  2. 02Hacer pruebas de carga con sus escenarios y su pico de llamadas.
  3. 03Fijar los requisitos de la caja a partir de los resultados.
  4. 04Solo entonces comprar el equipo.
07

Pruebas en su línea

Una voz que suena limpia en el navegador cruza una red móvil con compresión. Si la llamada pasa por dos tramos móviles, el audio se degrada dos veces. Lo probamos con un modelo de la línea: AMR-NB en cada tramo y G.711 entre ellos.

La voz del agente
sigue siendo inteligible incluso con mala cobertura: dirección, precio y teléfono llegan palabra por palabra
La voz de quien llama
sufren las respuestas cortas: «cien por cien» se queda en «cien». El agente vuelve a preguntar cuando algo suena raro
Latencia
cada tramo añade decenas de milisegundos; entra en el presupuesto de respuesta

Un modelo de línea es una aproximación. La calidad se decide con llamadas por su cadena real, y eso forma parte de la aceptación.

Escucharlo en la demo con «Dos tramos» →
08

Cómo se acepta el resultado

Los criterios se fijan antes de empezar, para que «terminado» signifique lo mismo para ambas partes.

Escenarios
Una lista acordada de conversaciones pasa en su línea de principio a fin, incluidas las difíciles: objeciones, interrupciones, cambios de tema.
Voz
Calidad en la línea real con su telefonía, no en un estudio ni en un navegador.
Velocidad de respuesta
Mediana y percentil 90 desde el fin de la frase hasta la voz, con la carga acordada.
Interrupción
El agente se calla cuando le interrumpen y no se para por un «ajá».
Datos
Los campos tras la llamada son correctos - nombre, teléfono, solicitud, fecha, resultado - y llegan donde ustedes trabajan.
09

Presupuesto

Si nos encargamos de todo el call center virtual: Asterisk, telefonía, el operador con IA, la integración y el lanzamiento.

Primera versión operativa
25-40 mil $
hasta 20-30 conversaciones simultáneas, escenarios y criterios de aceptación acordados
Soporte continuo
1,5-3 mil $ al mes
soporte, cambios de escenarios, seguimiento de calidad
Hardware o alquiler
aparte
para la opción local, ver arriba
Conectividad y licencias
aparte
troncal SIP, números, modelos en la nube si se usan

Es un orden de magnitud, no una tarifa. La cifra exacta llega cuando se fija el alcance: un operador que cualifica y transfiere y uno que vende y tramita pedidos cuestan distinto.

10

Por qué un hardware más sencillo no sirve

Las preguntas que surgen al mirar la tabla de arriba con ganas de ahorrar. En resumen: una o dos llamadas de prueba funcionan casi en cualquier cosa. Veinte o treinta conversaciones simultáneas respondidas en un segundo, no.

¿Por qué no una tarjeta gráfica de juegos, como una RTX 4090 o 5090?+

Tiene 24-32 GB de memoria. En una tarjeta tienen que caber el modelo de respuesta, el reconocimiento y la síntesis, más memoria para cada conversación en curso. Para 20-30 llamadas en paralelo no alcanza y las respuestas hacen cola. Además, la licencia de los drivers de NVIDIA prohíbe usar GeForce en centros de datos, no tienen memoria con corrección de errores (ECC) y su refrigeración no está pensada para 24/7 en un rack. Sirve para un prototipo de una o dos llamadas, no para producción.

¿Por qué no ejecutarlo todo en CPU, sin GPU?+

Un modelo de lenguaje en CPU tarda segundos por frase. El reconocimiento y la síntesis en tiempo real para decenas de flujos también chocan con la CPU. El presupuesto de respuesta es de un segundo, la mitad para el modelo. Con CPU no se cumple ni con una sola llamada.

¿Y una GPU pequeña, como una L4 de 24 GB o una T4 antigua?+

Para un piloto con pocas llamadas, quizá: es la opción 1 de la tabla, pero más débil. El problema son los picos: cuando cinco personas terminan de hablar a la vez, sus respuestas hacen cola y un segundo se convierte en tres a cinco. La T4 además no soporta formatos de cálculo modernos y es bastante más lenta. Solo compensa si el pico es de un par de llamadas.

¿Y un Mac Studio o un mini PC con mucha memoria?+

Ejecuta bien un solo modelo y es cómodo para desarrollar. Pero está hecho para un flujo: atiende mal decenas de conversaciones en paralelo, porque no agrupa peticiones como las GPU de servidor. Y no hay gestión de servidor, redundancia ni operación normal en rack.

¿Por qué no elegir un modelo más pequeño que quepa en hardware más barato?+

Un modelo pequeño cabe, pero sigue peor el guion: confunde precios, se va del tema, acepta descuentos que no existen y maneja peor los idiomas. Lo vimos en pruebas incluso entre modelos en la nube del mismo nivel: uno respondía breve y según las reglas, otro igual de rápido se iba en monólogos. El tamaño del modelo es un compromiso entre calidad de conversación y hardware, y hay que probarlo con sus escenarios.

¿Por qué dimensionar el hardware para el pico y no para la media?+

Las llamadas llegan en oleadas: por la mañana, tras un envío, a mediodía. La latencia no sube poco a poco: salta en cuanto las peticiones superan lo que la tarjeta procesa. Un servidor pensado para la media responde en tres segundos en el pico, justo cuando más gente llama.

¿Se puede empezar barato y ampliar después?+

Sí, y es el camino correcto. Primero alquiler y pruebas de carga, luego la opción 1 para un piloto. La arquitectura permite repartir reconocimiento, síntesis y modelo de respuesta en servidores distintos, así que crecer es añadir hardware, no rehacer el sistema.

Por dónde empezar

Escuche primero al agente. Si este orden de presupuesto le encaja, el siguiente paso es describir la primera entrega y fijar qué debe funcionar en la aceptación.

Cuánto cuesta: desde $99 al mes · ¿Qué llamadas salientes hace el agente?

Llamar a la demoHablar de una entrega

Asistentes que responden a tus clientes funcionando sobre los sistemas que ya usas. El servicio de automatización vive en inite.ai.

Email[email protected]
OfficeOperaciones remotas globales

Ecosistema INITE

  • INITE AI
  • INITE Education
  • INITE Club
  • INITE Events
  • INITE Fund
  • INITE Digital
  • INITE Rent
  • INITE Estate
  • INITE Shop
  • INITE Studio
  • INITE Health
  • INITE Travel
  • INITE Sport

Empresa

  • Sobre nosotros
  • Productos
  • Notas de campo
  • Auditoría de encaje
  • Qué modelos y cómo
  • Cómo tratamos la IA

Proyectos y soluciones

  • Voice AI
  • Sales AI
  • Social AI
  • Omni AI

Automatización con INITE

Se vende y se entrega en inite.ai

  • Servicios
  • Metodología
  • Planes de servicio
  • Casos de Estudio
  • Recursos

© 2025 INITE SOLUTIONS. Todos los derechos reservados.

Política de privacidadTérminos y condicionesPolítica de cookiesProtección de datos
LanguagesEnglish/Русский/Español/Português