中文

通过评判员之眼:推断思考轨迹提升LLM评估者的可靠性

人工智能 2026-02-23 v2 计算与语言 人机交互

摘要

大型语言模型(LLMs)正日益被用作评估任务的评判员,但其可靠性往往在主观任务中受限,此时人类判断涉及超出标注标签的细微推理。思考轨迹(thinking traces)即判断背后的推理过程,信息量极大,但收集和整理具有挑战性。我们提出了从仅包含标签的标注中推断思考轨迹的人类-LLM协作框架。该框架使用简单有效的拒绝抽样方法按规模重构这些轨迹。我们将推断得到的思考轨迹应用于两种互补任务:(1) 微调开放式LLM评估员;(2) 为专有LLM评估员综合更清晰的标注指南。我们在多个数据集上实现了显著改善LLM与人类的一致性。此外,精炼后的标注指南还会提高不同LLM模型之间的一致性。这些结果表明,LLM可作为 otherwise unrevealed 人类思考轨迹的实用替代品,使仅包含标签的语料库可扩展为具有思考轨迹的资源,从而提升LLM评估员的可靠性。

关键词

引用

@article{arxiv.2510.25860,
  title  = {Through the Judge's Eyes: Inferred Thinking Traces Improve Reliability of LLM Raters},
  author = {Xingjian Zhang and Tianhong Gao and Suliang Jin and Tianhao Wang and Teng Ye and Eytan Adar and Qiaozhu Mei},
  journal= {arXiv preprint arXiv:2510.25860},
  year   = {2026}
}