中文

迈向自动化错误发现:对话 AI 中的研究

计算与语言 2025-09-16 v1 人工智能 人机交互 机器学习

摘要

尽管基于大语言模型的对话代理展现出强大的流畅性和连贯性,但它们仍然会产生难以在部署过程中阻止其到达用户的不良行为(错误)。近期研究利用大语言模型(LLM)来检测错误并引导响应生成模型进行改进。然而,当前的 LLM 难以识别指令中未明确指定的错误,例如由响应生成模型更新或用户行为变化引起的错误。在本工作中,我们提出自动化错误发现(Automated Error Discovery),一个用于检测和定义对话 AI 中错误的框架,并提出 SEEED(基于软聚类的扩展编码器错误检测,Soft Clustering Extended Encoder-Based Error Detection),作为一种基于编码器的实现方法。我们通过放大负样本的距离权重来增强软最近邻损失,并引入基于标签的样本排序(Label-Based Sample Ranking)来选择高对比性示例以实现更好的表征学习。SEEED 在多个错误标注对话数据集上优于经过调整的基线方法——包括 GPT-4o 和 Phi-4——将未知错误的检测准确率提高了最多 8 个百分点,并展现出对未知意图检测的强大泛化能力。

关键词

引用

@article{arxiv.2509.10833,
  title  = {Towards Automated Error Discovery: A Study in Conversational AI},
  author = {Dominic Petrak and Thy Thy Tran and Iryna Gurevych},
  journal= {arXiv preprint arXiv:2509.10833},
  year   = {2025}
}

备注

Accepted to EMNLP 2025 main conference