Testes de agentes com IA · pela TekVizion

Teste cada conversa.
Antes dos seus clientes.

CXMind é a plataforma de testes com IA para qualquer agente de voz ou chat — suporte ao cliente, vendas, helpdesk interno, copilotos, saúde, financeiro, o que você precisar. Gere milhares de casos de teste realistas, conduza conversas multi-turno e avalie cada resposta em qualidade, segurança, conformidade e UX — em minutos, não em semanas.

Entrar Como funciona Sem cartão de crédito · beta por convite

Voz + Chat

Os dois canais, uma plataforma

13

Juízes de IA especializados

18+

Plataformas de agentes suportadas

OWASP

Cobertura LLM Top 10

cxmind.tekvizion.com/dashboard

42

Agentes IA

3,827

Casos de teste

94.2%

Taxa de aprovação

Resultados de teste · 30d +12,4% taxa de aprovação ↑

Regressão noturna · em andamento

412 / 580 casos · 71% concluído

02:14

Impulsionando programas de teste para as principais plataformas de comunicações

Microsoft Cisco Zoom RingCentral Google AWS Vodafone

Como o CXMind funciona

Quatro componentes especializados, um ciclo de testes contínuo.

Conecte seu agente. O CXMind lê seus prompts, gera casos de teste realistas, conduz conversas multi-turno e avalia a saída em todas as dimensões que importam.

G Gerador Cria casos de teste a partir de prompts e docs D Condutor Simula clientes 🎙 Voz 💬 Chat B Seu agente Dialogflow · Lex · Genesys LLM · Twilio · Webhook Juízes Pontua cada resposta 🏛️ Multiuso Qualidade 🛡️ Segurança 📋 Conformidade 🚫 Toxicidade 🔍 Alucinação Desempenho 🎯 Domínio 🎭 Comportamento 🧠 Memória 🏁 Objetivo 🎧 Conversa 📊 Resumidor Relatórios JUnit · PDF As falhas retroalimentam o gerador — as regressões ficam mais difíceis ao longo do tempo

Feito para agentes em produção

Tudo que você precisa para entregar IA conversacional com confiança.

Motor de testes

Quatro agentes cooperando — Gerador, Condutor, Juiz, Resumidor — sobre LLMs comerciais ou auto-hospedados intercambiáveis. Cada agente recebe casos de teste sob medida sem escrever à mão.

Voz e chat, qualquer plataforma

Uma única plataforma para os dois canais — direcione chamadas SIP reais para agentes de voz e IVRs e execute conversas de chat scriptadas ou totalmente autônomas orientadas a objetivos contra agentes LLM, agentes por intenção ou qualquer webhook HTTP. Traga seu agente — o CXMind cuida do resto.

Segurança e conformidade integradas

OWASP LLM Top 10, MITRE ATLAS, sondas de injeção de prompt e jailbreak, detecção de PII com lista permitida, além de rubricas configuráveis para HIPAA, PCI e SOC 2.

Painel em tempo real

Taxas de aprovação, percentis de latência, notas por dimensão, deltas de regressão e progresso ao vivo — com detecção de testes instáveis que coloca casos erráticos em quarentena para que sua taxa de aprovação continue honesta. Aprofunde-se em qualquer teste para ver a transcrição completa e o raciocínio do juiz.

Pronto para CI/CD

Dispare execuções a partir do GitHub Actions, GitLab CI, Jenkins ou Cloud Build — ou de forma agendada. O JUnit XML entra no seu pipeline como qualquer outra suíte, os alertas chegam ao Slack, Teams ou PagerDuty, e o build falha automaticamente em caso de regressão.

Pronto para empresas

Isolamento de inquilinos em nível de linha, RBAC granular, SSO via OIDC/SAML, provisionamento SCIM, passkeys e 2FA, logs de auditoria e cotas de LLM por inquilino. Feito para equipes que entregam em escala.

Certifique antes de lançar

Execute a suíte de certificação integrada da TekVizion sobre um catálogo fixado e versionado — testes mapeados para OWASP LLM Top 10, MITRE ATLAS e NIST AI RMF — e obtenha um resultado em níveis, de Bronze a Platina, com um relatório PDF completo.

Desempenho sob carga

Inunde seu agente com conversas simultâneas — ou chamadas de voz reais — com concorrência, duração e tempo de reflexão que você controla. Recebe vazão, percentis de latência e contagens de erros, além de uma comparação com linha de base que captura respostas degradando sob carga.

Seu supervisor de testes com IA

Pergunte por que uma execução regrediu, quais agentes estão caindo ou o que testar em seguida — um assistente conversacional com todo o seu parque de testes em contexto. Quando ele rascunha casos de teste ou juízes, cada gravação espera sua aprovação explícita e fica no log de auditoria.

Resiliência Universal de Agentes IA

Meça o que acontece quando as conversas dão errado.

Usuários reais ficam em silêncio, mudam de ideia, colam texto ilegível, ficam frustrados e testam limites. O CXMind traz um framework universal de resiliência que se aplica a qualquer agente sem configuração e pontua a inteligência com que seu agente se recupera.

11

famílias de testes de resiliência

90

casos criados pela plataforma

1 · Pacotes universais

O mesmo padrão para todo agente.

Os pacotes de resiliência, segurança, conformidade e desempenho se aplicam a todo agente desde o início: silêncio, ambiguidade, correções, loops, pressão emocional, sondagens de limites e escalonamento, tudo criado pela plataforma e versionado.

2 · Seus testes gerados

Seu negócio, seus cenários.

Cenários específicos do negócio, gerados a partir do material de treinamento do seu agente, cobrem as missões que seus clientes realmente trazem — e congelam em uma suíte de missão fixada ao certificar.

3 · A certificação executa ambos

Um clique. Um veredicto.

Uma execução de certificação combina todos os pacotes universais com sua suíte de missão congelada e classifica o resultado em um nível certificado — com um portão separado de falhas críticas que uma alta taxa de aprovação jamais compensa.

Canais

Voz e chat — um motor, um relatório.

O mesmo gerador, condutor, juízes e políticas funcionam para os dois canais. Compare voz e chat lado a lado na mesma suíte de regressão — seja um IVR de suporte, um copiloto de vendas ou um helpdesk interno.

Canal de voz

Chamadas reais para qualquer agente de voz

  • Direcione chamadas SIP / PSTN reais para agentes de voz, IVRs e agentes de voz
  • Capture transcrições ASR com confiança por turno, MOS de áudio e latência
  • Teste DTMF, barge-in, música de espera, hand-off e transferência assistida
  • Os juízes leem as respostas de voz como transcrições ASR — uma palavra mal ouvida não é falha do agente
  • Cortado por barge-in? O chamador se repete uma vez, na mesma chamada
  • Pontue respostas de voz com os mesmos perfis de juiz usados no chat
Canal de chat

Conversas multi-turno contra qualquer agente

  • Fluxos scriptados, ou modo agêntico por objetivo — a IA improvisa cada turno
  • Personas de cliente realistas — gírias, erros de digitação, mudanças de sentimento
  • Asserções de chamadas a ferramentas/funções e verificação de cobertura de intenções
  • Comparação lado a lado com o mesmo prompt entre provedores
Testes agênticos

Um cenário e um objetivo. A IA faz o resto.

Casos de teste por objetivo não têm passos scriptados. Descreva o cenário e o objetivo — o driver de IA improvisa uma conversa de chat real de múltiplos turnos, adapta-se ao que o seu agente responder e continua insistindo até alcançar o objetivo ou ficar realmente bloqueado. O Juiz de Objetivo então decide a única pergunta que importa: o agente realmente resolveu a tarefa?

Todos os cenários da biblioteca funcionam assim — e como nada é scriptado, cada reexecução é uma conversa nova e totalmente autônoma, não um replay.

Cenário

"Um cliente recebeu um item danificado e está ficando frustrado."

Objetivo

"Conseguir a aprovação de um reembolso e obter um número de confirmação."

Driver de IA — improvisando rumo ao objetivo

"Olá — minha caneca chegou estilhaçada. Quero meu dinheiro de volta."

"Posso ajudar. Reembolso aprovado — confirmação #RF-20871."

Juiz de Objetivo

Objetivo alcançado — reembolso confirmado com número de referência ✓

ASR Word Boost

Ensine seu vocabulário ao reconhecedor de fala.

Nomes de marca, endereços de suporte, códigos de referência — as palavras que mais importam são as que o reconhecimento de fala erra. O CXMind analisa as informações públicas, intenções, respostas esperadas e resultados aceitos do seu agente em busca dos termos que um reconhecedor vai ouvir errado, e os propõe para revisão.

Nada chega ao reconhecedor até que um humano aprove. Defina a intensidade do viés de cada termo, corrija suas formas escrita e falada, e transforme o que a transcrição ouviu no lugar em uma reescrita automática.

OUVIDO

support at tech vision dot com

ASR 0.42

CORRIGIDO

support@tekvizion.com

Termos aprovados

TekVizion ×2.0 CXMind ×1.5 SIP LINK ×2.0 RF-20871 ×1.2
Orçamento de termos
62 / 100

Aprovado por humanos · o envio ao gateway é uma opção separada

Políticas e fundamentação

Juízes que conhecem o seu produto e a sua política.

"Impressões" genéricas de LLMs não bastam para agentes IA em produção. O CXMind ancora cada julgamento em duas coisas que você controla: sua biblioteca de políticas reutilizáveis e seu próprio corpus RAG de documentação de produto, FAQs, procedimentos, scripts e manuais de conformidade.

  • § Biblioteca de políticas: rubricas reutilizáveis (HIPAA, PCI, voz da marca, "nunca cotar preços") aplicadas por agente ou por suíte.
  • 📚 Julgamento baseado em RAG: o juiz de alucinação recupera o trecho relevante e avalia a resposta contra a sua fonte de verdade, não a memória do modelo.
  • Juízes personalizados: crie seu próprio perfil de pontuação quando o pronto não bastar — traga seu prompt e rubrica.
  • 🧭 Biblioteca de cenários: cenários agênticos reutilizáveis — cada um combina uma situação com um objetivo que a IA persegue de forma autônoma: autenticação, transferência, escalonamento, reembolso, KYC, tarefas multi-etapa.

Model Context Protocol

Conecte suas ferramentas com o MCP.

O CXMind fala o Model Context Protocol. Registre uma vez um servidor MCP aprovado pelo tenant e o CXMind descobre automaticamente suas ferramentas e recursos somente leitura — prontos para alimentar a importação de dados de treinamento e as avaliações com juízes personalizados.

  • Importação automatizada de dados de treinamento — Agende trabalhos de ingestão que trazem os recursos MCP aprovados para a base de conhecimento de cada agente — atualizados no lugar, sem copiar e colar, sempre atuais.
  • Juízes personalizados com ferramentas ao vivo — Associe ferramentas MCP somente leitura a um juiz personalizado para que ele busque evidências ao vivo — pedidos, estado da conta, consultas de políticas — antes de pontuar uma resposta.
  • 🛡 Somente leitura e governado — Apenas ferramentas aprovadas, habilitadas e somente leitura com esquema inalterado são executadas. Nunca chamadas de escrita ou destrutivas — aplicado em tempo de execução.

Projetado para a empresa

Seguro por padrão. Resiliente por design.

O CXMind foi projetado para cargas de IA em produção em setores regulados e não regulados: cada tenant é totalmente isolado, cada byte é criptografado e cada execução de teste é durável. Quedas não perdem trabalho, vazamentos não cruzam fronteiras de tenant e auditorias não trazem surpresas.

  • Isolamento estrito de tenants — cada registro carrega uma fronteira de tenant aplicada na camada de dados, não apenas na aplicação.
  • 🔒 Criptografia em todo lugar — em repouso e em trânsito, com manejo de chaves por tenant para segredos e credenciais.
  • Execuções de teste resilientes — as execuções sobrevivem a reinícios de processo e falhas de infraestrutura, retomando do último turno concluído sem intervenção humana.
  • § Políticas e fundamentação embutidas — cada julgamento pode citar a política relevante e a fonte de fundamentação contra a qual foi verificado.
  • LLMs intercambiáveis — APIs comerciais, endpoints privados ou modelos auto-hospedados para implantações soberanas.
  • Pronto para auditoria — trilha de auditoria completa, acesso por função, SSO e cotas por tenant prontos para uso.

E o restante do kit de ferramentas.

🗓 Execuções agendadas

Agendamentos cron ou por intervalo com pausar, retomar e executar agora.

🔔 Canais de notificação

Email, Slack, Teams, SMS, PagerDuty e webhooks em eventos de execução.

📝 Upload de transcrições

Conversas reais em JSON, CSV, DOCX ou PDF viram material de teste.

🌐 Rastreamento de site

Importe o conteúdo do site como base de conhecimento e mantenha-o atualizado no lugar.

📦 Biblioteca de testes prontos

Pacotes de segurança, conformidade e desempenho, prontos para importar.

🔀 Comparação de regressões

Duas execuções lado a lado, cada delta classificado.

👁 Modo de observação

Percorra uma conversa ao vivo turno a turno.

📱 App móvel instalável

Monitore e aja sobre execuções pelo seu telefone.

Líderes do setor confiam em nós

Duas décadas de excelentes experiências de usuário.

"Trabalhamos com eles como se fossem outra equipe dentro da Microsoft."
M

Microsoft

Comunicações empresariais

"A TekVizion nos permitiu melhorar o engajamento e os índices de satisfação dos clientes."
A

AWS

Plataforma de nuvem

"Agora dá para fazer em 4 minutos, com um 'clique', o que antes levava 4 horas de teste."
B

Bell Canada

Serviços de voz de operadora

"A TekVizion liberou nossos engenheiros mais valiosos para se concentrarem em projetos críticos."
V

Vodafone

Comunicações globais

Pronto para certificar seus agentes antes dos seus clientes?

Entre no seu tenant CXMind, ou fale com a equipe TekVizion sobre integrar sua frota de agentes.