KI-gestütztes Testen von KI-Agenten · von TekVizion

Teste jedes Gespräch.
Bevor es deine Kund:innen tun.

CXMind ist die KI-Testplattform für jeden Sprach- oder Chat-Agenten — Kundenservice, Vertrieb, interne Helpdesks, Copilots, Healthcare, Banking, was immer du brauchst. Erzeuge Tausende realistische Testfälle, führe Mehrturn-Gespräche und bewerte jede Antwort nach Qualität, Sicherheit, Compliance und UX — in Minuten, nicht in Wochen.

Anmelden So funktioniert's Keine Kreditkarte · Beta nur auf Einladung

Sprache + Chat

Beide Kanäle, eine Plattform

13

Spezialisierte KI-Bewerter

18+

Unterstützte KI-Agent-Plattformen

OWASP

LLM Top 10 Abdeckung

cxmind.tekvizion.com/dashboard

42

KI-Agenten

3,827

Testfälle

94.2%

Erfolgsrate

Testergebnisse · 30T +12,4 % Erfolgsrate ↑

Nächtliche Regression · läuft

412 / 580 Fälle · 71 % fertig

02:14

Treibstoff für Testprogramme führender Kommunikationsplattformen

Microsoft Cisco Zoom RingCentral Google AWS Vodafone

So funktioniert CXMind

Vier spezialisierte Komponenten, eine durchgehende Testschleife.

KI-Agenten einbinden. CXMind übernimmt den Rest: Prompts lesen, realistische Testfälle erzeugen, mehrstufige Gespräche führen und die Ausgabe in jeder relevanten Dimension bewerten.

G Generator Erstellt Testfälle aus Prompts + Docs D Driver Simuliert Kund:innen 🎙 Sprache 💬 Chat B Dein KI-Agent Dialogflow · Lex · Genesys LLM · Twilio · Webhook Bewerter Bewertet jede Antwort 🏛️ Allzweck Qualität 🛡️ Sicherheit 📋 Compliance 🚫 Toxizität 🔍 Halluzination Leistung 🎯 Domäne 🎭 Verhalten 🧠 Gedächtnis 🏁 Ziel 🎧 Konversation 📊 Zusammenfasser Berichte JUnit · PDF Fehler fließen zurück in den Generator — Regressionen werden mit der Zeit schwieriger

Für KI-Agenten im Produktiveinsatz entwickelt

Alles, was du brauchst, um Conversational AI mit Vertrauen auszuliefern.

Test-Engine

Vier kooperierende Komponenten — Generator, Driver, Bewerter, Zusammenfasser — basierend auf austauschbaren kommerziellen oder selbst gehosteten LLMs. Jeder KI-Agent erhält passgenaue Testfälle ohne manuelles Schreiben.

Sprache und Chat, jede Plattform

Eine Plattform für beide Kanäle — echte SIP-Anrufe an Sprach-Agenten und IVRs leiten und geskriptete oder vollständig autonome, zielgesteuerte Chat-Gespräche mit LLM-Agenten, intentbasierten KI-Agenten oder beliebigen HTTP-Webhooks führen. Bring deinen KI-Agenten mit — CXMind erledigt den Rest.

Sicherheit und Compliance, eingebaut

OWASP LLM Top 10, MITRE ATLAS, Prompt-Injection- und Jailbreak-Sonden, PII-Erkennung mit Allowlist sowie konfigurierbare Richtlinienraster für HIPAA, PCI und SOC 2.

Echtzeit-Dashboard

Bestehensquoten, Latenz-Perzentile, Dimensionswerte, Regressionsdeltas und Live-Fortschritt — mit Flake-Erkennung, die instabile Fälle in Quarantäne stellt, damit Ihre Quote ehrlich bleibt. Öffnen Sie jeden Test für das vollständige Transkript und die Begründung des Richters.

CI/CD-fertig

Starten Sie Läufe aus GitHub Actions, GitLab CI, Jenkins oder Cloud Build — oder nach Zeitplan. JUnit-XML fügt sich wie jede andere Suite in Ihre Pipeline ein, Alarme landen in Slack, Teams oder PagerDuty, und der Build schlägt bei Regressionen automatisch fehl.

Enterprise-fähig

Mandantenisolation auf Zeilenebene, feingranulares RBAC, SSO über OIDC/SAML, SCIM-Provisionierung, Passkeys und 2FA, Audit-Logs und LLM-Kontingente pro Mandant. Gebaut für Teams, die im großen Maßstab liefern.

Zertifizieren vor dem Launch

Führen Sie die integrierte TekVizion-Zertifizierungssuite über einen fixierten, versionierten Katalog aus — Tests zugeordnet zu OWASP LLM Top 10, MITRE ATLAS und NIST AI RMF — und erhalten Sie ein gestuftes Ergebnis von Bronze bis Platin mit vollständigem PDF-Bericht.

Leistung unter Last

Fluten Sie Ihren KI-Agenten mit parallelen Konversationen — oder echten Sprachanrufen — mit selbst gewählter Parallelität, Dauer und Denkzeit. Zurück kommen Durchsatz, Latenz-Perzentile und Fehlerzahlen, plus ein Baseline-Vergleich, der unter Last degradierende Antworten aufdeckt.

Ihr KI-Test-Supervisor

Fragen Sie, warum ein Lauf schlechter wurde, welche KI-Agenten nachlassen oder was als Nächstes zu testen ist — ein Konversationsassistent mit Ihrem gesamten Testbestand im Kontext. Wenn er Testfälle entwirft oder Bewertungen vornimmt, wartet jeder Schreibvorgang auf Ihre ausdrückliche Freigabe und landet im Audit-Log.

Universelle KI-Agent-Resilienz

Messen Sie, was passiert, wenn Gespräche schieflaufen.

Echte Nutzer verstummen, ändern ihre Meinung, fügen unlesbaren Text ein, werden ungeduldig und testen Grenzen. CXMind liefert ein universelles Resilienz-Framework, das ohne Konfiguration für jeden KI-Agenten gilt, und bewertet, wie intelligent sich Ihr KI-Agent erholt.

11

Resilienz-Testfamilien

90

plattformseitig erstellte Fälle

1 · Universelle Pakete

Dieselbe Messlatte für jeden KI-Agenten.

Resilienz-, Sicherheits-, Compliance- und Performance-Pakete gelten ab Werk für jeden KI-Agenten: Stille, Mehrdeutigkeit, Korrekturen, Schleifen, emotionaler Druck, Grenztests und Eskalation — alles plattformseitig erstellt und versioniert.

2 · Ihre generierten Tests

Ihr Geschäft, Ihre Szenarien.

Geschäftsspezifische Szenarien, die aus dem Trainingsmaterial Ihres KI-Agenten generiert werden, decken die Anliegen ab, die Ihre Kunden tatsächlich mitbringen — und werden bei der Zertifizierung in einer fixierten Missions-Suite eingefroren.

3 · Die Zertifizierung führt beides aus

Ein Klick. Ein Urteil.

Ein Zertifizierungslauf kombiniert alle universellen Pakete mit Ihrer eingefrorenen Missions-Suite und stuft das Ergebnis in eine zertifizierte Stufe ein — mit einem separaten Gate für kritische Fehler, das eine hohe Bestehensquote niemals aufwiegen kann.

Kanäle

Sprache und Chat — eine Engine, ein Report.

Derselbe Generator, Driver, dieselben Bewerter und Policies laufen gegen beide Kanäle. Vergleiche Sprache und Chat Seite an Seite in derselben Regressions-Suite — egal ob Support-IVR, Sales-Copilot oder interner Helpdesk.

Sprach-Kanal

Echte Anrufe an jeden Sprach-Agenten

  • Echte SIP-/PSTN-Anrufe an Sprachbots, IVRs und Sprach-Agenten treiben
  • ASR-Transkripte mit Konfidenz pro Gesprächsschritt, Audio-MOS und Latenz erfassen
  • DTMF, Barge-in, Wartemusik, Hand-off und Warm-Transfer testen
  • Richter lesen Sprachantworten als ASR-Transkripte — ein falsch gehörtes Wort ist kein Fehler des KI-Agenten
  • Durch Barge-in unterbrochen? Der Anrufer wiederholt sich einmal — im selben Anruf
  • Sprach-Antworten mit denselben Bewerter-Profilen wie Chat bewerten
Chat-Kanal

Mehrstufige Gespräche mit jedem KI-Agenten

  • Gescriptete Abläufe oder agentischer Ziel-Modus — die KI improvisiert jeden Zug
  • Realistische Kunden-Personas — Slang, Tippfehler, Stimmungswechsel
  • Assertions auf Tool-/Funktionsaufrufe und Intent-Coverage-Checks
  • Side-by-Side-Vergleich mit demselben Prompt über mehrere Anbieter
Agentisches Testen

Ein Szenario und ein Ziel. Die KI erledigt den Rest.

Zielbasierte Testfälle haben keine geskripteten Schritte. Beschreibe Szenario und Ziel — der KI-Driver improvisiert ein echtes mehrstufiges Chat-Gespräch, passt sich an jede Antwort deines KI-Agenten an und bleibt dran, bis das Ziel erreicht oder wirklich blockiert ist. Der Ziel-Judge entscheidet dann die einzige Frage, die zählt: Hat der KI-Agent die Aufgabe wirklich erledigt?

Jedes Szenario in der Bibliothek funktioniert so — und weil nichts gescriptet ist, ist jeder erneute Lauf ein frisches, vollständig autonomes Gespräch statt einer Wiederholung.

Szenario

„Ein Kunde hat einen beschädigten Artikel erhalten und wird langsam ungeduldig.“

Ziel

„Eine Rückerstattung genehmigen lassen und eine Bestätigungsnummer erhalten.“

KI-Driver — improvisiert Richtung Ziel

„Hallo — meine Tasse kam zerbrochen an. Ich will mein Geld zurück.“

„Ich helfe gern. Rückerstattung genehmigt — Bestätigung #RF-20871.“

Ziel-Judge

Ziel erreicht — Rückerstattung mit Referenznummer bestätigt ✓

ASR Word Boost

Bringen Sie der Spracherkennung Ihr Vokabular bei.

Markennamen, Support-Adressen, Referenzcodes — die wichtigsten Wörter sind genau die, die die Spracherkennung falsch versteht. CXMind durchsucht die öffentlichen Informationen, Intents, erwarteten Antworten und akzeptierten Ergebnisse Ihres KI-Agenten nach Begriffen, die ein Erkenner falsch hören wird, und schlägt sie zur Prüfung vor.

Nichts erreicht die Erkennung, bevor ein Mensch es freigibt. Legen Sie fest, wie stark jeder Begriff gewichtet wird, korrigieren Sie Schreib- und Sprechform und machen Sie aus dem, was das Transkript stattdessen gehört hat, eine automatische Korrektur.

GEHÖRT

support at tech vision dot com

ASR 0.42

KORRIGIERT

support@tekvizion.com

Freigegebene Begriffe

TekVizion ×2.0 CXMind ×1.5 SIP LINK ×2.0 RF-20871 ×1.2
Begriffs-Budget
62 / 100

Von Menschen freigegeben · das Senden ans Gateway ist ein separater Opt-in-Schalter

Richtlinien & Grounding

Bewerter, die dein Produkt und deine Policy kennen.

Generische LLM-„Bauchgefühle“ reichen für produktive KI-Agenten nicht aus. CXMind verankert jede Bewertung in zwei Dingen, die du kontrollierst: deiner wiederverwendbaren Policy-Bibliothek und deinem eigenen RAG-Korpus aus Produktdokumenten, FAQs, SOPs, Skripten und Compliance-Handbüchern.

  • § Richtlinien-Bibliothek: wiederverwendbare Raster (HIPAA, PCI, Markensprache, „keine Preise nennen“), die auf einzelne KI-Agenten oder Suiten angewendet werden.
  • 📚 RAG-fundierte Bewertung: der Halluzinations-Bewerter ruft die relevante Passage ab und bewertet die Antwort gegen deine Quelle der Wahrheit, nicht gegen das Modell-Gedächtnis.
  • Eigene Bewerter: schreibe dein eigenes Bewertungs-Profil, wenn Standard nicht reicht — bring deinen eigenen Prompt + Raster mit.
  • 🧭 Szenario-Bibliothek: wiederverwendbare agentische Szenarien — jedes kombiniert eine Situation mit einem Ziel, das die KI autonom verfolgt: Auth, Weiterleitung, Eskalation, Rückerstattung, KYC, mehrstufige Aufgaben.

Model Context Protocol

Verbinden Sie Ihre Tools mit MCP.

CXMind spricht das Model Context Protocol. Registrieren Sie einmal einen vom Tenant freigegebenen MCP-Server, und CXMind erkennt automatisch dessen schreibgeschützte Tools und Ressourcen — bereit für den Import von Trainingsdaten und Bewertungen durch eigene Bewerter.

  • Automatisierter Import von Trainingsdaten — Planen Sie Ingestion-Jobs, die freigegebene MCP-Ressourcen in die Wissensbasis jedes KI-Agenten übernehmen — direkt am Ort aktualisiert, ohne Copy-and-paste, immer aktuell.
  • Eigene Bewerter mit Live-Tools — Verknüpfen Sie schreibgeschützte MCP-Tools mit einem eigenen Bewerter, damit er Live-Belege abrufen kann — Bestellungen, Kontostatus, Richtlinien-Abfragen — bevor er eine Antwort bewertet.
  • 🛡 Schreibgeschützt und kontrolliert — Es laufen nur freigegebene, aktivierte, schreibgeschützte Tools mit unverändertem Schema. Niemals schreibende oder destruktive Aufrufe — zur Laufzeit erzwungen.

Für Unternehmen entwickelt

Standardmäßig sicher. Resilient by Design.

CXMind ist für produktive KI-Workloads in regulierten wie unregulierten Branchen gebaut: jeder Tenant ist vollständig isoliert, jedes Byte ist verschlüsselt und jeder Testlauf ist dauerhaft. Ausfälle verlieren keine Arbeit, Sicherheitsverletzungen überschreiten keine Tenant-Grenzen und Audits überraschen dich nicht.

  • Strikte Mandantenisolation — jeder Datensatz trägt eine Mandantengrenze, die in der Datenebene erzwungen wird — nicht nur in der App.
  • 🔒 Verschlüsselung überall — im Ruhezustand und bei der Übertragung, mit mandantenbezogenem Schlüsselmanagement für Secrets und Zugangsdaten.
  • Resiliente Testläufe — Läufe überstehen Prozess-Neustarts und Infrastruktur-Ausfälle und setzen ohne menschliches Eingreifen am letzten abgeschlossenen Turn fort.
  • § Richtlinien und Grounding eingebaut — jede Bewertung kann die relevante Richtlinie und die Grounding-Quelle nennen, gegen die geprüft wurde.
  • Austauschbare LLMs — kommerzielle APIs, private Endpoints oder selbst gehostete Modelle für souveräne Deployments.
  • Audit-bereit — vollständiger Audit-Trail, rollenbasierter Zugriff, SSO und Mandanten-Quotas direkt out-of-the-box.

Und der Rest des Werkzeugkastens.

🗓 Geplante Läufe

Cron- oder Intervallpläne mit Pausieren, Fortsetzen und Sofortstart.

🔔 Benachrichtigungskanäle

E-Mail, Slack, Teams, SMS, PagerDuty und Webhooks bei Laufereignissen.

📝 Transkript-Upload

Echte Konversationen als JSON, CSV, DOCX oder PDF werden zu Testmaterial.

🌐 Website-Crawling

Importieren Sie Website-Inhalte als Wissensbasis und halten Sie sie an Ort und Stelle aktuell.

📦 Vorgefertigte Testbibliothek

Sicherheits-, Compliance- und Performance-Pakete, bereit zum Import.

🔀 Regressionsvergleich

Zwei Läufe nebeneinander, jedes Delta klassifiziert.

👁 Beobachtungsmodus

Gehen Sie eine laufende Konversation Schritt für Schritt durch.

📱 Installierbare Mobil-App

Überwachen und steuern Sie Läufe vom Smartphone aus.

Marktführer vertrauen uns

Zwei Jahrzehnte herausragender Nutzererlebnisse.

"Wir arbeiten mit ihnen, als wären sie ein weiteres Team innerhalb von Microsoft."
M

Microsoft

Unternehmenskommunikation

"TekVizion hat uns geholfen, Kundenbindung und Zufriedenheitswerte zu verbessern."
A

AWS

Cloud-Plattform

"Wir können jetzt mit einem 'Klick' in 4 Minuten erledigen, was zuvor 4 Stunden Tests gedauert hat."
B

Bell Canada

Carrier-Sprachdienste

"TekVizion hat unsere wertvollsten Ingenieure freigespielt, damit sie sich auf kritische Projekte konzentrieren können."
V

Vodafone

Globale Kommunikation

Bereit, deine KI-Agenten zu zertifizieren, bevor es deine Kund:innen tun?

Melde dich in deinem CXMind-Tenant an oder sprich mit dem TekVizion-Team über das Onboarding deiner KI-Agent-Flotte.