TIAR:基于轨迹信息的优势重加权用于大语言模型弃权学习
计算与语言
2026-05-26 v1 人工智能
机器学习
摘要
本文研究了大语言模型(LLM)的弃权学习,特别是使用三元奖励,该奖励激励大语言模型中的真实性。本文通过将三元奖励转变为基于轨迹信息的优势重加权来扩展这一思想,在组相对策略优化(GRPO)训练期间动态地重新加权弃权奖励。这项工作的目标侧重于弃权学习而非提高真实性,作为对减少幻觉的探索。本文的新颖之处在于方法论创新、优势重加权和基准选择。利用GRPO的多条轨迹作为自然的弃权信号,该方法使用奖励信号来探索知识边界并鼓励一致性。通过证明轨迹可以用作策略相对于查询的置信度指标,然后利用它们来动态计算弃权优势。使用AbstentionBench作为评估基准,因为这项工作旨在为弃权学习领域做出贡献。针对该方法和各种基线,对基准上的所有数据集进行了测试。实证结果表明,TIAR在六个评估类别中的五个类别上取得了最先进的弃权F1分数,在31个基准数据集中的17个上优于静态三元基线,同时完全保留了基线的准确性。
引用
@article{arxiv.2605.25850,
title = {TIAR: Trajectory-Informed Advantage Reweighting for LLM Abstention Learning},
author = {Muyu Pan and Shu Zhao and Nan Zhang and Philip Shin and Varun Parekh and Vijaykrishnan Narayanan and Rui Zhang},
journal= {arXiv preprint arXiv:2605.25850},
year = {2026}
}
备注
10 pages, 1 figure, 4 tables