经典纠正的内生奖励
计算与语言
2026-04-14 v1
摘要
开放式文本生成的强化学习受限于缺乏可验证的奖励,迫使依赖需要标注数据或强大闭源模型的判官模型。以最近在数学推理中使用基于置信度的内生奖励进行无监督强化学习为灵感,我们调查这一原则是否可适用于开放式写作任务。我们发现,直接应用置信度奖励会导致平凡偏差:策略向高概率输出方向崩溃,降低多样性和有意义内容。我们提出 TCER(Triviality Corrected Endogenous Reward),通过奖励专家策略与通用参考策略之间的相对信息增益来解决这一偏差,并受概率依赖校正机制的调制。针对多个写作基准和模型架构,TCER 在无需外部监督的情况下实现了持续的改进。进一步地,TCER 也能有效地转移到数学推理中,验证了该方法在不同生成任务中的普适性。
引用
@article{arxiv.2604.11522,
title = {Triviality Corrected Endogenous Reward},
author = {Xinda Wang and Zhengxu Hou and Yangshijie Zhang and Bingren Yan and Jialin Liu and Chenzhuo Zhao and Zhibo Yang and Bin-Bin Yang and Feng Xiao},
journal= {arXiv preprint arXiv:2604.11522},
year = {2026}
}