BaNEL:基于负奖励的生成模型探索后验
机器学习
2025-10-13 v1 人工智能
摘要
当今的生成模型依赖大量监督数据和信息丰富的奖励函数来衡量生成质量。它们假设监督数据为模型提供预训练知识,奖励函数提供关于如何进一步提升生成质量和正确性的稠密信息。然而,在重要问题的极端情形下,会出现两个问题:(1)基础生成模型获得接近零的奖励信号,(2)调用奖励oracle的成本很高。这一设定构成了与标准奖励后训练完全不同的学习挑战。为此,我们提出BaNEL(Bayesian Negative Evidence Learning),一种仅使用失败尝试、同时最小化奖励评估次数(NREs)的后训练算法。我们的方法基于这样一种思想:将学习底层失败规律的问题可被视为另一个内循环的生成模型问题。我们随后利用该模型来评估新数据是否类似于之前看到的失败情况,并引导生成远离这些失败。我们展示,BaNEL无需观察到任何成功样本即可提升多个稀疏奖励任务上的模型性能,成功率比现有新颖奖励方法高出多个数量级,同时使用的奖励评估次数更少。
引用
@article{arxiv.2510.09596,
title = {BaNEL: Exploration Posteriors for Generative Modeling Using Only Negative Rewards},
author = {Sangyun Lee and Brandon Amos and Giulia Fanti},
journal= {arXiv preprint arXiv:2510.09596},
year = {2025}
}