中文

双模型推理时 verbal reflection:一个不错于一

计算与语言 2025-09-30 v2

摘要

尽管偏好优化方法已改善大型语言模型(LLM)的推理性能,但它们往往缺乏关于为何一个推理结果优于另一个推理结果的透明度。这一限制在自动学生答案评分(ASAS)中尤为关键,因为可解释性对于正当化评估结果至关重要。言语强化学习有望生成显式反思,但倾向于产生浅层批评,可能损害评估性能。现有的 LLM 也难以可靠检测 ASAS 任务中细微的推理错误。此外,手动识别中间推理错误昂贵且难以规模化。为此,我们引入一种对比反思合成管道,通过识别结构推理图路径之间的差异来生成精确的言语反馈。利用这些合成反思数据,我们提出了 DARS,即双模型反思评分框架, featuring 一个专门为有效反思训练的 Critic 模型。DARS 在所有评估指标上都表现出强性能并持续优于现有 ASAS baseline。广泛的实验进一步提供了关于反思数据价值、框架设计以及 DARS 规模行为的新见解。我们在 https://github.com/lijiazheng99/DARS 上发布了 DARS 代码。

关键词

引用

@article{arxiv.2502.19230,
  title  = {Two Heads Are Better Than One: Dual-Model Verbal Reflection at Inference-Time},
  author = {Jiazheng Li and Yuxiang Zhou and Junru Lu and Gladys Tyen and Lin Gui and Cesare Aloisi and Yulan He},
  journal= {arXiv preprint arXiv:2502.19230},
  year   = {2025}
}

备注

Accepted at EMNLP 2025 Oral