Test degli agenti potenziato dall'IA · A cura di TekVizion

Testa ogni conversazione.
Prima che lo facciano i tuoi clienti.

CXMind è la piattaforma di test basata sull'IA per qualsiasi agente vocale o di chat: assistenza clienti, vendite, helpdesk interni, copilot, sanità, banking e molto altro. Genera migliaia di casi di test realistici, conduci conversazioni multi-turno e valuta ogni risposta in termini di qualità, sicurezza, conformità ed esperienza utente — il tutto in minuti, non settimane.

Accedi Come funziona Senza carta di credito · Beta su invito

Voce + Chat

Entrambi i canali, un'unica piattaforma

13

Giudici IA specializzati

18+

Piattaforme per agenti IA supportate

OWASP

Copertura LLM Top 10

cxmind.tekvizion.com/dashboard

42

Agenti IA

3,827

Casi di test

94.2%

Tasso di successo

Risultati dei test · 30g +12,4% tasso di successo ↑

Regressione notturna · in corso

412 / 580 casi · 71% completato

02:14

Alla base dei programmi di test delle principali piattaforme di comunicazione

Microsoft Cisco Zoom RingCentral Google AWS Vodafone

Come funziona CXMind

Quattro componenti specializzati, un ciclo di test continuo.

Collega il tuo agente. CXMind legge i tuoi prompt, genera casi di test realistici, conduce conversazioni multi-turno e valuta ogni risposta su tutte le dimensioni che contano.

G Generatore Crea casi di test a partire da prompt e documenti D Driver Simula i clienti 🎙 Voce 💬 Chat B Il tuo agente IA Dialogflow · Lex · Genesys LLM · Twilio · Webhook Giudici Valuta ogni risposta 🏛️ Multiuso Qualità 🛡️ Sicurezza 📋 Conformità 🚫 Tossicità 🔍 Allucinazione Prestazioni 🎯 Dominio 🎭 Comportamento 🧠 Memoria 🏁 Obiettivo 🎧 Conversazione 📊 Summarizer Report JUnit · PDF I fallimenti rientrano nel Generatore — col tempo le regressioni diventano più difficili

Pensato per gli agenti in produzione

Tutto ciò che ti serve per rilasciare IA conversazionale con sicurezza.

Motore di test

Quattro componenti che cooperano — Generatore, Driver, Giudice, Summarizer — costruiti su LLM commerciali o self-hosted intercambiabili. Ogni agente ottiene casi di test su misura, senza scrittura manuale.

Voce e chat, su qualsiasi piattaforma

Una sola piattaforma per entrambi i canali — instrada chiamate SIP reali verso agenti vocali e IVR ed esegue conversazioni di chat scriptate o completamente autonome guidate da obiettivi con agenti LLM, agenti basati su intenti o qualsiasi webhook HTTP. Tu porti l'agente, a tutto il resto pensa CXMind.

Sicurezza e conformità, integrate

OWASP LLM Top 10, MITRE ATLAS, sonde di prompt injection e jailbreak, rilevamento di PII con allowlist, oltre a rubriche di policy configurabili per HIPAA, PCI e SOC 2.

Dashboard in tempo reale

Tassi di successo, percentili di latenza, punteggi per dimensione, delta di regressione e avanzamento in tempo reale — con rilevamento dei test instabili che mette in quarantena i casi erratici, così il tuo tasso di successo resta onesto. Approfondisci ogni test per la trascrizione completa e la motivazione del giudice.

Pronto per CI/CD

Avvia esecuzioni da GitHub Actions, GitLab CI, Jenkins o Cloud Build — o su pianificazione. Il JUnit XML entra nella tua pipeline come qualsiasi altra suite, gli avvisi arrivano su Slack, Teams o PagerDuty e la build fallisce automaticamente in caso di regressione.

Pronto per le aziende

Isolamento dei tenant a livello di riga, RBAC granulare, SSO via OIDC/SAML, provisioning SCIM, passkey e 2FA, log di audit e quote LLM per tenant. Costruito per team che rilasciano su larga scala.

Certifica prima del rilascio

Esegui la suite di certificazione integrata di TekVizion su un catalogo fissato e versionato — test mappati su OWASP LLM Top 10, MITRE ATLAS e NIST AI RMF — e ottieni un risultato a livelli da Bronzo a Platino con un report PDF completo.

Prestazioni sotto carico

Inonda il tuo agente di conversazioni simultanee — o vere chiamate vocali — con concorrenza, durata e tempo di riflessione che controlli tu. Tornano portata, percentili di latenza e conteggi degli errori, più un confronto con la baseline che coglie le risposte che degradano sotto carico.

Il tuo supervisore di test IA

Chiedi perché un'esecuzione è peggiorata, quali agenti stanno calando o cosa testare dopo — un assistente conversazionale con tutto il tuo parco test nel contesto. Quando abbozza casi di test o giudici, ogni scrittura attende la tua approvazione esplicita e finisce nel log di audit.

Resilienza universale degli agenti

Misura cosa succede quando le conversazioni vanno male.

Gli utenti reali restano in silenzio, cambiano idea, incollano testo illeggibile, si innervosiscono e mettono alla prova i limiti. CXMind offre un framework universale di resilienza che si applica a ogni agente senza configurazione e valuta l'intelligenza con cui l'agente si riprende.

11

famiglie di test di resilienza

90

casi creati dalla piattaforma

1 · Pacchetti universali

Lo stesso standard per ogni agente.

I pacchetti di resilienza, sicurezza, conformità e prestazioni si applicano a ogni agente fin da subito: silenzio, ambiguità, correzioni, loop, pressione emotiva, sondaggi dei limiti ed escalation, tutti creati dalla piattaforma e versionati.

2 · I tuoi test generati

Il tuo business, i tuoi scenari.

Gli scenari specifici del business, generati dal materiale di addestramento del tuo agente, coprono le missioni che i tuoi clienti portano davvero — e si congelano in una suite di missione fissata al momento della certificazione.

3 · La certificazione esegue entrambi

Un clic. Un verdetto.

Un'esecuzione di certificazione combina tutti i pacchetti universali con la tua suite di missione congelata e classifica il risultato in un livello certificato — con un gate separato per i guasti critici che un alto tasso di successo non può mai riscattare.

Canali

Voce e chat — un solo motore, un solo report.

Lo stesso generatore, driver, giudici e policy operano su entrambi i canali. Confronta voce e chat fianco a fianco, nella stessa suite di regressione — sia che tu stia testando un IVR di supporto, un copilot di vendita o un helpdesk interno.

Canale voce

Chiamate reali verso qualsiasi agente vocale

  • Instrada chiamate SIP / PSTN reali verso agenti vocali, IVR e voice bot
  • Cattura trascrizioni ASR con confidenza per turno, MOS audio e latenza
  • Testa DTMF, barge-in, musica d'attesa, hand-off e trasferimento assistito
  • I giudici leggono le risposte vocali come trascrizioni ASR: una parola sentita male non è un errore dell'agente
  • Interrotto dal barge-in? Il chiamante si ripete una volta, nella stessa chiamata
  • Valuta le risposte vocali con gli stessi profili di giudice usati per la chat
Canale chat

Conversazioni multi-turno con qualsiasi agente

  • Flussi scriptati, o modalità agentica a obiettivo — l'IA improvvisa ogni turno
  • Persona cliente realistiche — slang, refusi, cambi di sentiment
  • Assertion su chiamate a tool/funzione e verifiche di copertura degli intent
  • Confronto affiancato con lo stesso prompt tra diversi provider
Test agentici

Uno scenario e un obiettivo. Al resto pensa l'IA.

I test case basati su obiettivi non hanno passi scriptati. Descrivi lo scenario e l'obiettivo — il driver IA improvvisa una vera conversazione chat multi-turno, si adatta a qualsiasi risposta del tuo agente e insiste finché l'obiettivo non viene raggiunto o risulta davvero bloccato. Poi il Giudice degli Obiettivi decide sull'unica domanda che conta: l'agente ha davvero portato a termine il compito?

Ogni scenario della libreria funziona così — e poiché nulla è scriptato, ogni riesecuzione è una conversazione nuova e completamente autonoma, non un replay.

Scenario

"Un cliente ha ricevuto un articolo danneggiato e si sta innervosendo."

Obiettivo

"Far approvare un rimborso e ottenere un numero di conferma."

Driver IA — improvvisa verso l'obiettivo

"Salve — la mia tazza è arrivata in frantumi. Rivoglio i miei soldi."

"Posso aiutarla. Rimborso approvato — conferma #RF-20871."

Giudice degli Obiettivi

Obiettivo raggiunto — rimborso confermato con numero di riferimento ✓

ASR Word Boost

Insegna il tuo vocabolario al riconoscitore vocale.

Nomi di brand, indirizzi di supporto, codici di riferimento: le parole che contano di più sono proprio quelle che il riconoscimento vocale sbaglia. CXMind analizza le informazioni pubbliche, gli intenti, le risposte attese e gli esiti accettati del tuo agente alla ricerca dei termini che un riconoscitore sentirà male, e li propone per la revisione.

Nulla raggiunge il riconoscitore finché un umano non lo approva. Imposta quanto pesare ogni termine, correggi la forma scritta e parlata e trasforma ciò che la trascrizione ha sentito al suo posto in una riscrittura automatica.

SENTITO

support at tech vision dot com

ASR 0.42

CORRETTO

support@tekvizion.com

Termini approvati

TekVizion ×2.0 CXMind ×1.5 SIP LINK ×2.0 RF-20871 ×1.2
Budget dei termini
62 / 100

Approvato da un umano · l'invio al gateway è un interruttore opt-in separato

Policy e grounding

Giudici che conoscono il tuo prodotto e le tue policy.

Le "impressioni" generiche di un LLM non bastano per gli agenti IA in produzione. CXMind fonda ogni giudizio su due elementi che controlli tu: la tua libreria di policy riutilizzabili e il tuo corpus RAG composto da documenti di prodotto, FAQ, procedure operative, script e manuali di conformità.

  • § Libreria di policy: rubriche riutilizzabili (HIPAA, PCI, brand voice, "non quotare mai prezzi") applicate per agente o per suite.
  • 📚 Giudizio basato su RAG: il giudice anti-allucinazione recupera il passaggio rilevante e valuta la risposta rispetto alla tua source of truth, non rispetto alla memoria del modello.
  • Giudici personalizzati: crea il tuo profilo di scoring quando le soluzioni preconfezionate non bastano — porta la tua rubrica insieme al prompt.
  • 🧭 Libreria di scenari: scenari agentici riutilizzabili — ognuno abbina una situazione a un obiettivo che l'IA persegue in autonomia: autenticazione, trasferimento, escalation, rimborso, KYC, task multi-step.

Model Context Protocol

Collega i tuoi strumenti con MCP.

CXMind parla il Model Context Protocol. Registra una volta un server MCP approvato dal tenant e CXMind ne rileva automaticamente strumenti e risorse di sola lettura — pronti per alimentare l'importazione dei dati di addestramento e le valutazioni con giudici personalizzati.

  • Importazione automatizzata dei dati di addestramento — Pianifica job di ingestione che portano le risorse MCP approvate nella knowledge base di ogni agente — aggiornate sul posto, senza copia-incolla, sempre attuali.
  • Giudici personalizzati con strumenti dal vivo — Collega strumenti MCP di sola lettura a un giudice personalizzato perché raccolga prove dal vivo — ordini, stato dell'account, ricerche di policy — prima di valutare una risposta.
  • 🛡 Sola lettura e governato — Vengono eseguiti solo strumenti approvati, abilitati e di sola lettura con schema invariato. Mai chiamate di scrittura o distruttive — imposto in fase di esecuzione.

Progettato per l'enterprise

Sicuro per impostazione predefinita. Resiliente per progettazione.

CXMind è progettato per carichi di IA in produzione, in settori regolamentati e non: ogni tenant è completamente isolato, ogni byte è cifrato e ogni esecuzione di test è persistente. I disservizi non fanno perdere il lavoro, le violazioni non attraversano i confini tra tenant e gli audit non riservano sorprese.

  • Isolamento rigoroso dei tenant — ogni record porta un confine di tenant applicato nello strato dati, non solo nell'applicazione.
  • 🔒 Cifratura ovunque — a riposo e in transito, con gestione delle chiavi per tenant per segreti e credenziali.
  • Esecuzioni di test resilienti — le esecuzioni sopravvivono a riavvii dei processi e guasti infrastrutturali, riprendendo dall'ultimo turno completato senza intervento umano.
  • § Policy e grounding integrati — ogni giudizio può citare la policy rilevante e la fonte di grounding rispetto alla quale è stato verificato.
  • LLM intercambiabili — API commerciali, endpoint privati o modelli self-hosted per deployment sovrani.
  • Pronto per l'audit — audit trail completo, accesso basato sui ruoli, SSO e quote per tenant pronti all'uso.

E il resto del toolkit.

🗓 Esecuzioni pianificate

Pianificazioni cron o a intervalli con pausa, ripresa ed esecuzione immediata.

🔔 Canali di notifica

Email, Slack, Teams, SMS, PagerDuty e webhook sugli eventi di esecuzione.

📝 Caricamento trascrizioni

Conversazioni reali in JSON, CSV, DOCX o PDF diventano materiale di test.

🌐 Scansione del sito web

Importa i contenuti del sito come base di conoscenza e tienili aggiornati sul posto.

📦 Libreria di test predefiniti

Pacchetti di sicurezza, conformità e prestazioni, pronti da importare.

🔀 Confronto regressioni

Due esecuzioni fianco a fianco, ogni delta classificato.

👁 Modalità osservazione

Percorri una conversazione dal vivo un turno alla volta.

📱 App mobile installabile

Monitora e gestisci le esecuzioni dal tuo telefono.

Scelto dai leader di settore

Due decenni di grandi esperienze utente.

"Lavoriamo con loro come se fossero un altro team interno a Microsoft."
M

Microsoft

Comunicazioni enterprise

"TekVizion ci ha permesso di migliorare il coinvolgimento dei clienti e i punteggi di soddisfazione."
A

AWS

Piattaforma cloud

"Ora con un 'click' eseguiamo in 4 minuti il lavoro di test che prima ci richiedeva 4 ore."
B

Bell Canada

Servizi voce per operatori

"TekVizion ha liberato i nostri ingegneri più qualificati per concentrarli sui progetti critici."
V

Vodafone

Comunicazioni globali

Pronto a certificare i tuoi agenti prima che lo facciano i tuoi clienti?

Accedi al tuo tenant CXMind o parla con il team TekVizion per l'onboarding della tua flotta di agenti.