RankAlign: 生成器-验证器差距的排序视角
计算与语言
2025-09-03 v2
摘要
尽管大型语言模型(LLMs)在诸多任务上变得更加强大和准确,但其行为中仍存在一些根本性的不可靠性来源。一个关键限制是它们在提示变化时对相同信息的报告不一致。在本文中,我们以更严格的方式定义了生成器-验证器之间的差距:我们期望生成器和验证器在整个候选答案集合上的得分相关性,即在不违反格里昂规范的常规语言使用期间可能出现的候选完成项。我们展示根据此度量标准,在包括问答、词汇语义任务和下一词预测等各种设置中,均存在显著的差距。随后我们提出了RankAlign,一种基于排序的训练方法,并表明其显著缩小了差距,超越了所有基线方法。此外,该方法对外域任务和词汇项具有良好的泛化能力。
引用
@article{arxiv.2504.11381,
title = {RankAlign: A Ranking View of the Generator-Validator Gap in Large Language Models},
author = {Juan Diego Rodriguez and Wenxuan Ding and Katrin Erk and Greg Durrett},
journal= {arXiv preprint arXiv:2504.11381},
year = {2025}
}
备注
Published at COLM 2025