迈向自动化错误发现:对话 AI 中的研究
计算与语言
2025-09-16 v1 人工智能
人机交互
机器学习
摘要
尽管基于大语言模型的对话代理展现出强大的流畅性和连贯性,但它们仍然会产生难以在部署过程中阻止其到达用户的不良行为(错误)。近期研究利用大语言模型(LLM)来检测错误并引导响应生成模型进行改进。然而,当前的 LLM 难以识别指令中未明确指定的错误,例如由响应生成模型更新或用户行为变化引起的错误。在本工作中,我们提出自动化错误发现(Automated Error Discovery),一个用于检测和定义对话 AI 中错误的框架,并提出 SEEED(基于软聚类的扩展编码器错误检测,Soft Clustering Extended Encoder-Based Error Detection),作为一种基于编码器的实现方法。我们通过放大负样本的距离权重来增强软最近邻损失,并引入基于标签的样本排序(Label-Based Sample Ranking)来选择高对比性示例以实现更好的表征学习。SEEED 在多个错误标注对话数据集上优于经过调整的基线方法——包括 GPT-4o 和 Phi-4——将未知错误的检测准确率提高了最多 8 个百分点,并展现出对未知意图检测的强大泛化能力。
引用
@article{arxiv.2509.10833,
title = {Towards Automated Error Discovery: A Study in Conversational AI},
author = {Dominic Petrak and Thy Thy Tran and Iryna Gurevych},
journal= {arXiv preprint arXiv:2509.10833},
year = {2025}
}
备注
Accepted to EMNLP 2025 main conference