Comparativa de plataformas de agentes de voz con IA: precios reales y cómo elegir
automation 16 de agosto de 2026 · Mintec

Comparativa de plataformas de agentes de voz con IA: precios reales y cómo elegir

Vapi, Retell, Bland, Fonema, Kosmo y NextPhone comparados con su costo real por minuto, español latino, integraciones y el marco de decisión que usamos en Mintec.

No existe "la mejor plataforma de agentes de voz con IA": existen cuatro rutas con precios reales muy distintos, y la mayoría de las comparativas que encuentras en Google mienten por omisión. Vapi anuncia $0.05 por minuto y termina costando $0.13–0.33 cuando sumas modelos y telefonía. NextPhone cobra $199 al mes planos con llamadas ilimitadas. Fonema no cobra mensualidad, pero su telefonía cuesta $0.015 por minuto en México y $0.07 en Colombia o Perú. Elegir mal no es solo pagar de más: es un agente que suena forzado con tus clientes, una plataforma que no se integra con tu CRM, o un proyecto muerto a los 90 días. Aquí comparo las seis plataformas que más vemos en implementaciones latinoamericanas, con precios verificados en agosto de 2026, y el marco de decisión que usamos en Mintec.

Por qué el precio por minuto que anuncian es una media verdad

Empecemos por la trampa más común. Las plataformas globales venden "desde $0.05/min", pero ese número casi nunca incluye lo que hace que la llamada funcione:

  • El modelo de lenguaje (LLM), que decide qué responder: $0.02–0.30 por minuto según el modelo.
  • La transcripción (STT): ~$0.01/min.
  • La voz sintética (TTS): $0.05–0.15/min si quieres voces de calidad.
  • La telefonía (el número y la terminación de la llamada): $0.01–0.05/min en EE. UU., pero en varios países de Latinoamérica es más cara.

Un análisis independiente de CloudTalk (agosto 2026) calcula que una implementación real en Vapi termina costando $0.30–0.33 por minuto, seis veces el precio anunciado. Bland lo admite en su propia página: dice que los stacks típicos en Vapi van de $0.13 a $0.30 y en Retell de $0.11 a $0.25, y que su tarifa plana de $0.09 incluye los modelos. Cada quien jala para su lado, pero el rango real del mercado es claro: $0.07–0.35/min dependiendo de la ruta.

Y en Latinoamérica hay un costo extra que ninguna comparativa en inglés menciona: la telefonía por país. Fonema publica sus tarifas: $0.0152/min en México, $0.014 en EE. UU., pero $0.0537 en Argentina, $0.0428 en Chile y $0.07 en Colombia y Perú. Si contestas llamadas de varios países, tu costo por minuto puede duplicarse o triplicarse solo por la terminación.

Las 4 rutas para implementar un agente de voz (con precios reales)

En los proyectos que hemos visto en Mintec, todas las plataformas caen en una de cuatro rutas. Cada una resuelve un problema distinto y tiene una estructura de costos diferente.

Ruta 1: SaaS de recepcionista a tarifa fija — NextPhone, Kosmo

Son el "Netflix del agente de voz": pagas un plan mensual, configuras en un día, y no piensas en minutos ni en modelos. NextPhone cobra $199/mes planos con llamadas entrantes ilimitadas, 24/7, según su guía de precios de 2026. Es de las pocas plataformas sin medidor por minuto ni cargos por excedente. En México, Kosmo cobra en pesos: Básica $1,290 MXN (200 min), Starter $2,800 (900 min), PRO $4,800 (1,900 min) y PYME $6,800 (2,900 min) al mes.

La regla que usamos: si tu negocio recibe menos de ~500 minutos de llamadas al mes y nadie del equipo quiere tocar configuraciones, esta ruta es la correcta. El costo es predecible y el setup es de horas, no semanas. Ya explicamos en detalle qué puede hacer un agente de voz y cuánto te cuesta no tenerlo; esta ruta es la forma más rápida de empezar.

Ruta 2: Plataforma omnicanal latinoamericana por uso — Fonema

Fonema es la opción que más nos gusta para negocios que quieren voz y WhatsApp en el mismo agente, con español latino real: más de 200 voces regionales y latencia menor a 1.2 segundos. Su modelo de precios es "solo pagas lo que usas": sin mensualidad fija, telefonía por minuto según el país ($0.0152 México, $0.07 Colombia), interacciones adicionales (WhatsApp, email, acciones) a $0.01, y líneas de concurrencia extra a $15/mes cada una.

Para una pyme mexicana con 1,000 minutos al mes, la cuenta es brutalmente barata: ~$15/mes de telefonía. El catch: el ahorro depende de tu país y de las llamadas simultáneas que necesites; las primeras 5 líneas de concurrencia vienen incluidas.

Ruta 3: Plataforma global low-code por minuto — Retell, Bland

Cuando necesitas más control (integraciones con CRM, transferencia caliente, campañas salientes) sin equipo de desarrollo, entran las plataformas low-code con todo incluido en un solo número por minuto. Retell cobra $0.07+/min con modelos incluidos en el plan base, concurrencia ilimitada e integraciones nativas con n8n, HubSpot y Twilio. Bland cobra $0.09/min e incluye LLM, STT y TTS en esa tarifa; la telefonía se factura aparte al costo, y prometen desplegar un primer agente en un día.

Las elegimos cuando el cliente tiene un dueño técnico del proyecto (aunque sea un operaciones medio geek) y el agente necesita conversar con el CRM, no solo contestar. El costo real queda entre $0.07 y $0.25/min según la calidad de voz y el modelo.

Ruta 4: Orquestador para equipos de desarrollo — Vapi

Vapi es la más potente y la más cara en la práctica: cobra $0.05/min por la plataforma y pasa el costo de los modelos al cliente (puedes traer tus propias API keys). Con STT, LLM, TTS y telefonía, el costo real ronda $0.13–0.33/min, y los despliegues empresariales suelen necesitar presupuestos de $40,000–70,000 anuales según CloudTalk. A cambio tienes control total: elegir cada modelo, configurar latencia, herramientas personalizadas y 100+ idiomas.

Esta ruta solo tiene sentido si tienes un equipo de desarrollo que lo va a mantener. Si no, es la forma más cara de aprender a programar agentes de voz. Para negocios que sí quieren construir su propio stack, la arquitectura de chatbot con IA aplica el mismo principio al canal de voz.

Cuánto cuesta de verdad: la tabla a 1.000 minutos

Para una comparación honesta, esto pagaría un negocio promedio (1,000 minutos de llamadas al mes, agosto 2026):

PlataformaEstructuraCosto real ~1,000 min/mesEspañol latinoPara quién
NextPhone$199/mes planos, llamadas ilimitadas$199Sí, configurableCero setup, volumen bajo-medio, presupuesto predecible
Kosmo (MX)Planes en MXN con minutos$2,800–4,800 MXN según planRegional mexicanaPymes que facturan en pesos y quieren plan fijo
FonemaSolo uso (telefonía por país + $0.01 interacciones)~$15–70200+ voces regionales, <1.2sVoz + WhatsApp en un mismo agente, LatAm
Retell$0.07+/min, modelos incluidos$70–250Multi, requiere prueba localDueño técnico low-code, integraciones con CRM
Bland$0.09/min todo incluido + telefonía$90–140Multi, requiere prueba localEscala con una sola tarifa por minuto
Vapi$0.05/min + modelos + telefonía$130–330+Multi (traes tus modelos)Equipo de desarrollo, casos a medida

Si ya tienes un call center y solo quieres añadir IA encima, la ruta es otra: CloudTalk ($25–49 por usuario/mes) vende agentes de voz como add-on desde $99 por 200 minutos. Es la opción correcta cuando la IA es una capa más de un sistema telefónico que ya pagas.

El marco de decisión: 5 preguntas

Este es el orden que seguimos en Mintec cuando un cliente nos pide "un agente de voz":

  1. ¿Hay alguien técnico en el equipo? No → Ruta 1 o 2. Sí, low-code → Ruta 3. Equipo de desarrollo → Ruta 4.
  2. ¿Cuántos minutos reales de llamadas tienes al mes? Mide una semana y multiplica por 4.3; casi nadie lo hace. Menos de 500 → tarifa fija. 500–3,000 → por uso. Más de 3,000 → negocia volumen.
  3. ¿Necesitas voz y WhatsApp en el mismo agente? En México y Colombia el WhatsApp es el canal principal; si el agente de voz no continúa la conversación por chat, duplicas procesos. Ahí gana la ruta omnicanal (Fonema) o un handover humano-máquina bien hecho.
  4. ¿En qué países contestas? Si son México y EE. UU., la telefonía es barata en casi cualquier plataforma. Si entran Colombia, Perú o Argentina, revisa la tarifa de terminación por país antes de firmar: puede triplicar tu costo real por minuto.
  5. ¿Estás en una industria regulada? Salud, finanzas o datos personales cambian las reglas: necesitas HIPAA/BAA o acuerdos de residencia de datos, y eso solo está en los tiers enterprise. Aquí el ahorro por minuto es irrelevante frente a una multa.

La combinación de estas respuestas define la ruta. No hay respuesta "por plataforma": la hay por perfil de negocio.

Lo que los vendors no te dicen (y los clientes descubren en producción)

Después de implementar estas plataformas, estas son las sorpresas que repetimos en cada diagnóstico:

  • La latencia anunciada no es la real. Vapi presume <500ms, pero hay reportes de 6–7 segundos en configuraciones no optimizadas. Fonema y los SaaS publican números más conservadores (1.2s) que se cumplen mejor.
  • La concurrencia es el costo escondido. Vapi incluye 10 líneas simultáneas ($10/line/mes extra); Fonema, 5. Si tienes picos de llamadas (hora del almuerzo, campañas), el límite de concurrencia importa más que el precio por minuto.
  • La retención de datos cuesta. Vapi guarda historial de llamadas 14 días en el plan base; retención extendida se paga aparte ($1,000/mes). Si tu industria regula qué guardas, esto es requisito, no extra.
  • El 72% de los clientes quiere saber que habla con una IA (Salesforce, 2026). Ocultarlo no es gratis: los mejores agentes se presentan como IA desde el primer segundo y ganan con velocidad, no con engaño.
  • La tasa de cancelación de proyectos agentic es altísima. Gartner predice que más del 40% de los proyectos se cancelarán para 2027 y la confianza en agentes autónomos cayó del 43% al 27% en un año (Capgemini). Casi nunca es culpa del modelo: es elegir mal la plataforma o lanzar y olvidarse del mantenimiento (el problema del Día 2).

La prueba de 20 llamadas antes de firmar

Sea cual sea la ruta, no firmes sin la prueba de campo: graba 20 llamadas reales (o pide que las genere el vendor) donde el agente responda con el acento de tu región, no el de la demo. Escucha la transferencia a humano (el 73.8% de las llamadas bien manejadas terminan en un enrutamiento correcto: eso es éxito, no fracaso), mide cuántas resolvió sola y cuántas dejó caer, y compara el costo real con tu factura actual.

Elegir plataforma de voz no es elegir la más barata por minuto: es elegir la que sobrevive al contacto con tu operación real. En Mintec evaluamos tu volumen, países y procesos antes de tocar una API; y si lo que necesitas es el agente completo —voz, WhatsApp, CRM y automatización de chatbots—, esa evaluación es el primer paso del proyecto.

Preguntas Frecuentes

¿Cuánto cuesta un agente de voz con IA por minuto en 2026?

Los precios publicados van de $0.05 a $0.09 por minuto (Vapi, Retell, Bland), pero el costo real con modelos y telefonía va de $0.13 a $0.33 por minuto. Las alternativas de tarifa fija como NextPhone cuestan $199/mes con llamadas ilimitadas, y en Latinoamérica Fonema cobra solo telefonía por uso: desde $0.014/min en EE. UU. hasta $0.07/min en Colombia y Perú.

¿Cuál es la mejor plataforma de agentes de voz para español latino?

Fonema está diseñada para español latinoamericano, con más de 200 voces regionales y latencia menor a 1.2 segundos. Kosmo cobra en pesos mexicanos con planes desde $1,290 MXN/mes. Si eliges una plataforma global (Retell, Bland, Vapi), prueba con acentos reales de tu región antes de contratar: el español neutro no suena neutral para tus clientes.

¿Vapi, Retell o Bland: cuál elijo?

Vapi es un orquestador para equipos de desarrollo: pagas $0.05/min de plataforma más el costo de modelos (STT, LLM, TTS) y telefonía, con un costo real de $0.13–0.33/min. Retell ($0.07+/min) y Bland ($0.09/min) incluyen los modelos en un solo número y son low-code. Si no tienes equipo técnico, empieza con un SaaS de tarifa fija (NextPhone, Kosmo) o una plataforma omnicanal como Fonema.

Artículos Relacionados