中文

解释质量评估作为排序问题中的列表奖励

人工智能 2026-04-28 v1

摘要

我们将解释质量评估重新表述为排序问题,而非生成问题。我们不再优化模型以逐字生成单一的"最佳"解释,而是训练奖励模型来区分多个备选解释并学习其相对质量。具体而言,我们构建具有分级质量水平的 per-instance 备选集合,并训练 listwise 和 pairwise 排序模型(ListNet、LambdaRank、RankNet)以保持序数结构,避免 pointwise 回归或二元偏好目标中常见的得分压缩。我们观察到三个发现:首先,排序损失在所有测试域中都优于回归在得分分离方面。其次,最佳排序损失取决于数据特征:listwise 目标在质量层次清晰分离时表现更佳,而 pairwise 方法对噪声自然注释更稳健。第三,在精心策划和结构良好的数据上训练的小型编码器模型可以与规模数十倍的模型相媲美,这表明数据质量比模型规模更重要。最后,当用作政策优化的奖励时,基于排序的得分在回归基准奖励完全失效的情境中实现了稳定收敛。代码和数据可在 https://github.com/Tankiit/PPO_Learning_to_rank 获取。

关键词

引用

@article{arxiv.2604.24176,
  title  = {Explanation Quality Assessment as Ranking with Listwise Rewards},
  author = {Thomas Bailleux and Tanmoy Mukherjee and Emmanuel Lonca and Pierre Marquis and Zied Bouraoui},
  journal= {arXiv preprint arXiv:2604.24176},
  year   = {2026}
}