推理模型优于非推理LLM-Judge,却仍存在偏见
计算与语言
2026-05-15 v2
摘要
本文首次系统性比较探讨大型推理模型(LRM)是否优于非推理大语言模型。我们的实证分析得出四项关键发现:1)LRM在判断准确性方面优于非推理LLM,尤其在推理密集型任务方面表现更佳;2)LRM展示出更优的评估指令遵循能力;3)LRM对针对判断任务的对抗攻击具有更好的鲁棒性;4)然而,LRM仍存在显著的评估偏见。为缓解此偏见漏洞,我们提出PlanJudge——一种轻量级评估策略,通过在执行判断前引导模型生成明确的评估计划。尽管方法简单,但我们的实验表明,PlanJudge显著减轻了LLM评判中的偏见,同时保持了整体判断准确性。
引用
@article{arxiv.2601.03630,
title = {Reasoning Model Is Superior LLM-Judge, Yet Suffers from Biases},
author = {Hui Huang and Xuanxin Wu and Muyun Yang and Yuki Arase},
journal= {arXiv preprint arXiv:2601.03630},
year = {2026}
}
备注
Accepted by ACL 2026 Workshop EvalEval