LLM 藏匿与寻找出路:一种用于生成隐蔽错误与自我诊断的对抗游戏
人工智能
2025-08-06 v1
摘要
大型语言模型 (LLM) 在推理与跨领域生成方面表现卓越,但仍在识别与诊断复杂错误方面存在挑战。这主要源于训练目标侧重正确答案,导致对错误的暴露与学习受限。虽然近期研究开始通过引入错误信号来解决此问题,但大多数方法依赖浅层、静态错误,限制了深层诊断能力的提升。为克服这一局限,我们提出 Hide and Seek Game (HSG),一种用于错误生成与诊断的动态对抗框架,并在数学问题解决上进行评估。HSG 包含两个对抗角色:Sneaky 负责"隐藏",即生成细微、误导性的推理错误;Diagnosis 负责"寻出",即准确检测这些错误。通过对抗共演,错误的隐蔽性与诊断精度均得到提升。在多个数学推理任务上的实验表明,HSG 显著提升了错误诊断能力,准确率比 GPT-4o 等基线高出 16.8%--31.4%。我们还发布了一个包含具挑战性的误导性错误与诊断标注的数据集,以作为未来研究的基准。
引用
@article{arxiv.2508.03396,
title = {Hide and Seek with LLMs: An Adversarial Game for Sneaky Error Generation and Self-Improving Diagnosis},
author = {Rui Zou and Mengqi Wei and Yutao Zhu and Jirong Wen and Xin Zhao and Jing Chen},
journal= {arXiv preprint arXiv:2508.03396},
year = {2025}
}