标签效应:人类与LLM评判中基于相似启发策略的信任评估
人工智能
2026-04-08 v1 计算与语言
摘要
大语言模型(LLM)日益被用作自动评估器(LLM-as-a-Judge)。本工作通过揭示信任判断由LLM受source labels影响而偏离可靠性,来挑战其可靠性。使用反事实设计,我们发现无论是人类还是LLM评判者,都会将标记为人类撰写的信息置信度评定为高于标记为AI生成的相同内容。眼动数据揭示,人类严重依赖source labels作为判断的启发线索。我们分析了LLM在判断期间的内部状态。在各种标签条件下,模型在label区域分配更稠密的注意力,而在content区域注意力相对较少,这种标签主导效应在Human标签而非AI标签下更为强烈,这与人类视角模式一致。此外,在AI标签下,决策不确定性(由logits测量)高于Human标签。这些结果表明,source label是人类和LLM都依赖的显著启发线索。这引发了对标签敏感LLM-as-a-Judge评估的有效性 concerns,并谨慎地指出,与人类偏好一致化可能将人类启发策略依赖性传递给模型,激励去偏置化的评估和一致化。
引用
@article{arxiv.2604.05593,
title = {Label Effects: Shared Heuristic Reliance in Trust Assessment by Humans and LLM-as-a-Judge},
author = {Xin Sun and Di Wu and Sijing Qin and Isao Echizen and Abdallah El Ali and Saku Sugawara},
journal= {arXiv preprint arXiv:2604.05593},
year = {2026}
}