基于自适应推理与不确定性过滤的端到端聊天机器人评估
计算与语言
2026-03-12 v1
摘要
大型语言模型(LLM)结合检索增强生成技术已使领域特定聊天机器人得以部署,但这些系统仍容易生成不受支持或错误的答案。可靠的评估因此至关重要,但手动审阅成本高昂,现有框架往往依赖精选测试集和静态指标,限制了可扩展性。我们提出一种端到端自动评估器,旨在显著减少人工工作量。该系统直接从底层知识库生成问答对,使用 LLM 对聊天机器人响应相对于参考答案进行判断,并应用基于置信度的过滤来突出显示不确定案例。应用于越南新闻数据集时,评估器在与人类判断高度一致的同时,显著降低了审阅开销。该框架模块化且语言无关,能够轻松适应多样化的领域。这一工作引入了一种实用且可扩展的聊天机器人评估解决方案,最小化对人工干预的依赖。
引用
@article{arxiv.2603.10570,
title = {End-to-End Chatbot Evaluation with Adaptive Reasoning and Uncertainty Filtering},
author = {Nhi Dang and Tung Le and Huy Tien Nguyen},
journal= {arXiv preprint arXiv:2603.10570},
year = {2026}
}