面向弱监督的 LLM 真实性评估与训练:基于同伪预测的方法
计算机视觉与模式识别
2026-01-29 v1
摘要
大型语言模型 (LLM) 的评估和后训练依赖监督,但对于困难任务的强监督往往不可得,尤其是在评估前沿模型时。在这种情况下,模型会利用基于此类不完美监督构建的评估,导致欺骗性结果。然而,在 LLM 研究中,围绕机制设计中关注的博弈论激励相容性(即借助弱监督引出诚实且有信息量的答案)的工作被低估利用。drawing from this literature, 我们引入同伪预测方法用于模型评估和后训练。它奖励诚实且有信息量的答案,而非欺骗性且无信息量的答案,基于互可预测性度量,无需 ground truth 标签。我们通过理论保证和实证验证展示了该方法的有效性和对欺骗的抵抗力,针对最高可达 4050 亿参数的模型。我们显示,使用同伪预测基于奖励训练的 80 亿参数模型,能够恢复由于此前恶意微调导致的大部分真实性下降,即使该奖励是由 13.5 亿参数且未微调的语言模型产生的。在评估方面,与需要强监督和可信 judge 的 LLM-as-a-Judge 不同,我们发现同伪预测存在一种逆比例扩展属性,即当专家与参与者之间的能力差距扩大时,抵抗欺骗的能力反而增强,从而能够可靠地使用弱监督评估强模型。特别是,当 LLM-as-a-Judge 面对该 judge 规模的 5-20 倍的欺骗模型时,表现不如随机猜测,而同伪预测在此类大规模差距(包括超过 100 倍)下仍能蓬勃发展。
引用
@article{arxiv.2601.20297,
title = {Artifact-Aware Evaluation for High-Quality Video Generation},
author = {Chen Zhu and Jiashu Zhu and Yanxun Li and Meiqi Wu and Bingze Song and Chubin Chen and Jiahong Wu and Xiangxiang Chu and Yangang Wang},
journal= {arXiv preprint arXiv:2601.20297},
year = {2026}
}