Pruebas de agentes con IA · por TekVizion

Prueba cada conversación.
Antes que tus clientes.

CXMind es la plataforma de pruebas con IA para cualquier agente de voz o chat: atención al cliente, ventas, soporte interno, copilotos, salud, banca, lo que necesites. Genera miles de casos de prueba realistas, simula conversaciones de varios turnos y evalúa cada respuesta en calidad, seguridad, cumplimiento y experiencia, todo en minutos, no en semanas.

Iniciar sesión Cómo funciona Sin tarjeta de crédito · beta por invitación

Voz y chat

Ambos canales, una sola plataforma

13

Jueces de IA especializados

18+

Plataformas de agentes soportadas

OWASP

Cobertura LLM Top 10

cxmind.tekvizion.com/dashboard

42

Agentes IA

3,827

Casos de prueba

94.2%

Tasa de aprobación

Resultados de pruebas · 30d +12,4% tasa de aprobación ↑

Regresión nocturna · en curso

412 / 580 casos · 71% completado

02:14

Impulsando programas de pruebas para las principales plataformas de comunicaciones

Microsoft Cisco Zoom RingCentral Google AWS Vodafone

Cómo funciona CXMind

Cuatro componentes especializados, un ciclo de pruebas continuo.

Conecta tu agente. CXMind lee tus prompts, genera casos de prueba realistas, simula conversaciones de varios turnos y califica el resultado en cada dimensión que importa.

G Generador Crea casos de prueba a partir de prompts y docs D Conductor Simula clientes 🎙 Voz 💬 Chat B Tu agente Dialogflow · Lex · Genesys LLM · Twilio · Webhook Jueces Evalúa cada respuesta 🏛️ Multipropósito Calidad 🛡️ Seguridad 📋 Cumplimiento 🚫 Toxicidad 🔍 Alucinación Rendimiento 🎯 Dominio 🎭 Comportamiento 🧠 Memoria 🏁 Objetivo 🎧 Conversación 📊 Resumidor Informes JUnit · PDF Los fallos retroalimentan al generador — con el tiempo las regresiones son más difíciles

Construido para agentes en producción

Todo lo que necesitas para lanzar IA conversacional con confianza.

Motor de pruebas

Cuatro agentes cooperando — Generador, Conductor, Juez, Resumidor — sobre LLM comerciales o autoalojados intercambiables. Cada agente obtiene casos de prueba a medida sin redactarlos manualmente.

Voz y chat, en cualquier plataforma

Una sola plataforma para ambos canales: dirige llamadas SIP reales a agentes de voz e IVRs, y ejecuta conversaciones de chat guiadas o totalmente autónomas orientadas a objetivos contra agentes LLM, agentes por intención o cualquier webhook HTTP. Tú trae tu agente, CXMind se ocupa del resto.

Seguridad y cumplimiento, integrados

OWASP LLM Top 10, MITRE ATLAS, sondas de inyección de prompts y jailbreak, detección de PII con lista permitida, además de rúbricas configurables para HIPAA, PCI y SOC 2.

Panel en tiempo real

Tasas de aprobación, percentiles de latencia, puntuaciones por dimensión, deltas de regresión y progreso en vivo — con detección de pruebas inestables que pone en cuarentena los casos erráticos para que tu tasa de aprobación sea honesta. Profundiza en cualquier prueba para ver la transcripción completa y el razonamiento del juez.

Listo para CI/CD

Lanza ejecuciones desde GitHub Actions, GitLab CI, Jenkins o Cloud Build — o de forma programada. El JUnit XML encaja en tu pipeline como cualquier otra suite, las alertas llegan a Slack, Teams o PagerDuty, y la build falla automáticamente ante una regresión.

Listo para empresas

Aislamiento de inquilinos a nivel de fila, RBAC granular, SSO vía OIDC/SAML, aprovisionamiento SCIM, passkeys y 2FA, registros de auditoría y cuotas de LLM por inquilino. Hecho para equipos que lanzan a escala.

Certifica antes de lanzar

Ejecuta la suite de certificación integrada de TekVizion sobre un catálogo fijado y versionado — pruebas mapeadas a OWASP LLM Top 10, MITRE ATLAS y NIST AI RMF — y obtén un resultado por niveles de Bronce a Platino con un informe PDF completo.

Rendimiento bajo carga

Inunda tu agente con conversaciones concurrentes — o llamadas de voz reales — con la concurrencia, duración y tiempo de reflexión que tú controlas. Recibes rendimiento, percentiles de latencia y conteos de errores, además de una comparación con línea base que detecta respuestas que se degradan bajo carga.

Tu supervisor de pruebas con IA

Pregunta por qué empeoró una ejecución, qué agentes están decayendo o qué probar a continuación — un asistente conversacional con todo tu entorno de pruebas en contexto. Cuando redacta casos de prueba o jueces, cada escritura espera tu aprobación explícita y queda en el registro de auditoría.

Resiliencia Universal de Agentes IA

Mide lo que pasa cuando las conversaciones salen mal.

Los usuarios reales se quedan en silencio, cambian de opinión, pegan texto ilegible, se frustran y ponen a prueba los límites. CXMind incluye un marco universal de resiliencia que aplica a cualquier agente sin configuración y puntúa la inteligencia con la que tu agente se recupera.

11

familias de pruebas de resiliencia

90

casos creados por la plataforma

1 · Packs universales

El mismo listón para todos los agentes.

Los packs de resiliencia, seguridad, cumplimiento y rendimiento aplican a cualquier agente desde el primer momento: silencio, ambigüedad, correcciones, bucles, presión emocional, sondeos de límites y escalado, todo creado por la plataforma y versionado.

2 · Tus pruebas generadas

Tu negocio, tus escenarios.

Los escenarios específicos de negocio generados a partir del material de entrenamiento de tu agente cubren las misiones que tus clientes realmente traen, y se congelan en una suite de misión fija al certificar.

3 · La certificación ejecuta ambos

Un clic. Un veredicto.

Una ejecución de certificación combina todos los packs universales con tu suite de misión congelada y califica el resultado en un nivel certificado, con una puerta independiente de fallos críticos que una alta tasa de aprobados nunca puede compensar.

Canales

Voz y chat: un solo motor, un solo informe.

El mismo generador, conductor, jueces y políticas operan en ambos canales. Compara voz y chat en paralelo, en la misma suite de regresión, ya sea un IVR de soporte, un copiloto de ventas o un servicio interno.

Canal de voz

Llamadas reales a cualquier agente de voz

  • Dirige llamadas SIP / PSTN reales a agentes de voz, IVRs y agentes de voz
  • Captura transcripciones ASR con confianza por turno, MOS de audio y latencia
  • Prueba DTMF, barge-in, música en espera, hand-off y transferencia asistida
  • Los jueces leen las respuestas de voz como transcripciones ASR: una palabra mal oída no es un fallo del agente
  • ¿Interrumpido por barge-in? El llamante se repite una vez, dentro de la misma llamada
  • Evalúa respuestas de voz con los mismos perfiles de juez que el chat
Canal de chat

Conversaciones multi-turno contra cualquier agente

  • Flujos guiados, o modo agéntico por objetivos — la IA improvisa cada turno
  • Personas de cliente realistas — jerga, erratas, cambios de sentimiento
  • Aserciones de llamadas a herramientas/funciones y verificación de cobertura de intenciones
  • Comparativa lado a lado con el mismo prompt entre proveedores
Pruebas agénticas

Un escenario y un objetivo. La IA hace el resto.

Los casos de prueba por objetivos no tienen pasos guionizados. Describe el escenario y el objetivo: el driver de IA improvisa una conversación de chat real de varios turnos, se adapta a lo que responda tu agente y sigue insistiendo hasta alcanzar el objetivo o quedar realmente bloqueado. Después, el Juez de Objetivos dictamina sobre la única pregunta que importa: ¿el agente realmente hizo el trabajo?

Todos los escenarios de la biblioteca funcionan así — y como nada está guionizado, cada reejecución es una conversación nueva y totalmente autónoma, no una repetición.

Escenario

"Un cliente recibió un artículo dañado y se está frustrando."

Objetivo

"Conseguir la aprobación de un reembolso y obtener un número de confirmación."

Driver de IA — improvisando hacia el objetivo

"Hola, mi taza llegó hecha pedazos. Quiero que me devuelvan el dinero."

"Puedo ayudarte. Reembolso aprobado — confirmación #RF-20871."

Juez de Objetivos

Objetivo logrado — reembolso confirmado con número de referencia ✓

ASR Word Boost

Enséñale tu vocabulario al reconocedor de voz.

Nombres de marca, direcciones de soporte, códigos de referencia: las palabras que más importan son las que el reconocimiento de voz entiende mal. CXMind analiza la información pública, las intenciones, las respuestas esperadas y los resultados aceptados de tu agente en busca de los términos que un reconocedor oirá mal, y los propone para revisión.

Nada llega al reconocedor hasta que un humano lo aprueba. Define cuánto sesgar cada término, corrige sus formas escrita y hablada, y convierte lo que la transcripción oyó en su lugar en una reescritura automática.

ESCUCHADO

support at tech vision dot com

ASR 0.42

CORREGIDO

support@tekvizion.com

Términos aprobados

TekVizion ×2.0 CXMind ×1.5 SIP LINK ×2.0 RF-20871 ×1.2
Presupuesto de términos
62 / 100

Aprobado por humanos · el envío a la pasarela es un interruptor opcional aparte

Políticas y fundamentación

Jueces que conocen tu producto y tu política.

Las simples "impresiones" del LLM no bastan para los agentes IA en producción. CXMind fundamenta cada juicio en dos cosas que tú controlas: tu biblioteca de políticas reutilizables y tu propio corpus RAG de documentación, preguntas frecuentes, procedimientos, guiones y manuales de cumplimiento.

  • § Biblioteca de políticas: rúbricas reutilizables (HIPAA, PCI, voz de marca, "nunca dar precios") aplicadas por agente o por suite.
  • 📚 Juicio basado en RAG: el juez de alucinaciones recupera el pasaje relevante y evalúa la respuesta contra tu fuente de verdad, no contra la memoria del modelo.
  • Jueces personalizados: crea tu propio perfil de puntuación cuando lo estándar no basta — aporta tu prompt y tu rúbrica.
  • 🧭 Biblioteca de escenarios: escenarios agénticos reutilizables — cada uno combina una situación con un objetivo que la IA persigue de forma autónoma: autenticación, transferencia, escalado, reembolso, KYC, tareas multi-paso.

Model Context Protocol

Conecta tus herramientas con MCP.

CXMind habla el Model Context Protocol. Registra una vez un servidor MCP aprobado por el tenant y CXMind detecta automáticamente sus herramientas y recursos de solo lectura — listos para impulsar la importación de datos de entrenamiento y las evaluaciones con jueces personalizados.

  • Importación automatizada de datos de entrenamiento — Programa trabajos de ingesta que incorporan los recursos MCP aprobados a la base de conocimiento de cada agente — actualizados en su sitio, sin copiar y pegar, siempre al día.
  • Jueces personalizados con herramientas en vivo — Asocia herramientas MCP de solo lectura a un juez personalizado para que recupere evidencia en vivo — pedidos, estado de la cuenta, consultas de políticas — antes de puntuar una respuesta.
  • 🛡 Solo lectura y gobernado — Solo se ejecutan herramientas aprobadas, habilitadas y de solo lectura con un esquema sin cambios. Nunca llamadas de escritura ni destructivas — aplicado en tiempo de ejecución.

Pensado para la empresa

Seguro por defecto. Resiliente por diseño.

CXMind está diseñado para cargas de IA en producción en sectores regulados y no regulados: cada inquilino está totalmente aislado, cada byte está cifrado y cada ejecución de prueba es duradera. Las caídas no pierden trabajo, las brechas no cruzan límites de inquilino y las auditorías no te sorprenden.

  • Aislamiento estricto de tenants — cada registro lleva una frontera de tenant aplicada en la capa de datos, no solo en la aplicación.
  • 🔒 Cifrado en todas partes — en reposo y en tránsito, con manejo de claves por tenant para secretos y credenciales.
  • Ejecuciones de prueba resilientes — las ejecuciones sobreviven a reinicios y fallos de infraestructura, reanudándose desde el último turno completado sin intervención humana.
  • § Políticas y fundamentación incorporadas — cada juicio puede citar la política relevante y la fuente de fundamentación contra la que se verificó.
  • LLMs intercambiables — APIs comerciales, endpoints privados o modelos autoalojados para despliegues soberanos.
  • Listo para auditoría — registro de auditoría completo, acceso por rol, SSO y cuotas por tenant listos de fábrica.

Y el resto del kit de herramientas.

🗓 Ejecuciones programadas

Programaciones cron o por intervalos con pausa, reanudación y ejecución inmediata.

🔔 Canales de notificación

Email, Slack, Teams, SMS, PagerDuty y webhooks en eventos de ejecución.

📝 Carga de transcripciones

Conversaciones reales en JSON, CSV, DOCX o PDF se convierten en material de prueba.

🌐 Rastreo de sitios web

Importa el contenido del sitio como base documental y mantenlo actualizado en su lugar.

📦 Biblioteca de pruebas predefinidas

Paquetes de seguridad, cumplimiento y rendimiento, listos para importar.

🔀 Comparación de regresiones

Dos ejecuciones lado a lado, cada delta clasificado.

👁 Modo observación

Avanza por una conversación en vivo turno a turno.

📱 App móvil instalable

Supervisa y actúa sobre las ejecuciones desde tu teléfono.

Líderes del sector confían en nosotros

Dos décadas de excelentes experiencias de usuario.

"Trabajamos con ellos como si fueran otro equipo dentro de Microsoft."
M

Microsoft

Comunicaciones empresariales

"TekVizion nos permitió mejorar la interacción con el cliente y los índices de satisfacción."
A

AWS

Plataforma cloud

"Ahora hacemos un 'clic' y completamos en 4 minutos lo que antes nos llevaba 4 horas de pruebas."
B

Bell Canada

Servicios de voz de operador

"TekVizion liberó a nuestros ingenieros más valiosos para centrarse en proyectos críticos."
V

Vodafone

Comunicaciones globales

¿Listo para certificar tus agentes antes que tus clientes?

Inicia sesión en tu tenant de CXMind, o habla con el equipo de TekVizion para incorporar tu flota de agentes.