测试引擎
四个协作代理——生成器、驱动器、评判、汇总器——构建于可替换的商用或自托管 LLM 之上。每个AI 代理都能获得量身定制的测试用例,无需手工编写。
CXMind 是面向任意语音或聊天AI 代理的 AI 测试平台——客户支持、销售、内部服务台、副驾驶、医疗、金融,无论何种场景。生成上千个真实测试用例,驱动多轮对话,从质量、安全、合规和用户体验各维度评估每条回复——只需几分钟,而不是几周。
语音 + 聊天
双通道,单一平台
13
专业 AI 评判
18+
支持的AI 代理平台
OWASP
LLM Top 10 覆盖
42
AI 代理
3,827
测试用例
94.2%
通过率
每夜回归 · 进行中
412 / 580 用例 · 完成 71%
为领先的通信平台测试项目提供动力
CXMind 如何运作
接入你的AI 代理。CXMind 读取你的提示词,生成真实的测试用例,驱动多轮对话,并在每个关键维度上评估输出。
为生产级AI 代理而生
四个协作代理——生成器、驱动器、评判、汇总器——构建于可替换的商用或自托管 LLM 之上。每个AI 代理都能获得量身定制的测试用例,无需手工编写。
同一平台覆盖两个通道——向语音AI 代理和 IVR 发起真实的 SIP 通话,并对 LLM 代理、意图AI 代理或任何 HTTP webhook 运行脚本化或完全自主的目标驱动聊天对话。带上你的AI 代理,CXMind 处理其余一切。
OWASP LLM Top 10、MITRE ATLAS、提示注入与越狱探测、带允许列表的 PII 检测,以及面向 HIPAA、PCI、SOC 2 的可配置策略规则。
通过率、延迟百分位、维度评分、回归差异和实时运行进度——还有不稳定用例检测,将波动的用例隔离,让通过率保持真实。深入任意测试即可查看完整对话记录和评审理由。
从 GitHub Actions、GitLab CI、Jenkins 或 Cloud Build 触发运行——也可以按计划执行。JUnit XML 像任何测试套件一样接入流水线,告警发送到 Slack、Teams 或 PagerDuty,出现回归时构建自动失败。
行级租户隔离、细粒度 RBAC、OIDC/SAML 单点登录、SCIM 配置、通行密钥和双因素认证、审计日志以及按租户的 LLM 配额。为规模化交付的团队而建。
在固定且带版本的目录上运行内置的 TekVizion 认证套件——测试映射到 OWASP LLM Top 10、MITRE ATLAS 和 NIST AI RMF 主题——获得从铜级到白金级的分级结果和完整的 PDF 报告。
用并发对话——或真实语音呼叫——冲击你的AI 代理,并发数、时长和思考时间由你控制。返回吞吐量、延迟百分位和错误计数,还有基线对比,捕捉负载下答案质量的下降。
问它为什么某次运行退步了、哪些AI 代理在下滑、接下来该测什么——一个把你整个测试资产装进上下文的对话助手。当它起草测试用例或评审时,每次写入都要等你明确批准,并记入审计日志。
通用AI 代理韧性
真实用户会突然沉默、改变主意、粘贴乱码、感到沮丧并试探边界。CXMind 提供通用韧性框架,无需配置即适用于任何AI 代理,并为AI 代理的恢复智能打分。
11
韧性测试族
90
平台编写的用例
1 · 通用测试包
韧性、安全、合规和性能测试包开箱即用地适用于每个AI 代理:沉默、歧义、更正、循环、情绪压力、边界试探和升级,全部由平台编写并进行版本管理。
2 · 您的生成测试
根据代理自身训练材料生成的业务场景覆盖客户真正提出的任务——并在认证时冻结为固定的任务套件。
3 · 认证同时运行两者
认证运行将所有通用测试包与您冻结的任务套件相结合,并将结果评为认证等级——另设独立的严重故障门槛,高通过率永远无法弥补。
通道
同一套生成器、驱动器、评判和策略在两个通道上运行。在同一回归套件中并排比较语音和聊天——无论是支持 IVR、销售副驾驶还是内部服务台。
基于目标的测试用例没有脚本步骤。只需描述场景和目标——AI 驱动器即兴展开真实的多轮聊天对话,随时适应AI 代理的回复,并持续推进,直到达成目标或确实受阻。随后目标裁判只裁定一个真正重要的问题:AI 代理到底有没有把事办成?
场景库中的每个场景都以这种方式运行——因为没有任何脚本,每次重跑都是一次全新的、完全自主的对话,而不是回放。
场景
“一位顾客收到了破损的商品,情绪越来越激动。”
目标
“让退款获得批准并拿到确认编号。”
AI 驱动器——朝目标即兴推进
“你好——我的杯子到货时碎了,我要退款。”
“我来帮您。退款已批准——确认号 #RF-20871。”
目标裁判
目标达成——退款已确认并附参考编号 ✓
品牌名称、客服邮箱、参考编码——最重要的词往往正是语音识别最容易听错的词。CXMind 会扫描代理的公开信息、意图、预期回复和已接受结果,找出识别器容易听错的词条并提交人工审核。
未经人工批准,任何词条都不会发送给识别器。你可以设置每个词条的偏置强度,修正其书写和口语形式,并把转写中实际听错的内容变成自动改写规则。
识别结果
support at tech vision dot com
纠正后
support@tekvizion.com
已批准的词条
人工批准 · 发送到网关是另一个单独的可选开关
策略与依据
通用 LLM 的“感觉”不足以用于生产级 AI 代理。CXMind 将每一次判断都根植于你掌控的两件事:你的可复用策略库和你自己的 RAG 语料(产品文档、常见问题、操作规程、脚本和合规手册)。
Model Context Protocol
CXMind 支持 Model Context Protocol。只需注册一次经租户批准的 MCP 服务器,CXMind 便会自动发现其只读工具与资源——可用于导入训练数据和自定义评判评估。
为企业构建
CXMind 为受监管和非监管行业的生产级 AI 工作负载而设计:每个租户完全隔离,每个字节都加密,每次测试都持久化。故障不会丢失工作,泄露不会跨越租户边界,审计不会带来意外。
🗓 定时运行
Cron 或间隔调度,支持暂停、恢复和立即运行。
🔔 通知渠道
运行事件触发 Email、Slack、Teams、短信、PagerDuty 和 webhook。
📝 对话记录上传
JSON、CSV、DOCX 或 PDF 格式的真实对话变成测试素材。
🌐 网站抓取
导入网站内容作为知识依据,并原地保持更新。
📦 预置测试库
安全、合规与性能测试包,随时可导入。
🔀 回归对比
两次运行并排对比,每个差异都被归类。
👁 观察模式
逐轮走查一场实时对话。
📱 可安装的移动应用
在手机上监控并处理测试运行。
行业领导者的信赖之选
"我们与他们合作就像他们是 Microsoft 内部的另一支团队。"
Microsoft
企业通信
"TekVizion 帮助我们提升了客户互动与满意度分数。"
AWS
云平台
"我们现在只需一‘点’,即可在 4 分钟内完成原本需要 4 小时的测试。"
Bell Canada
运营商语音服务
"TekVizion 让我们的高价值工程师可以专注于关键项目。"
Vodafone
全球通信