MAVRL:基于 amortize 变分推断学习多反馈类型的奖励函数
机器学习
2026-02-18 v1 人工智能
摘要
奖励学习通常依赖单一反馈类型或通过手动加权损失项组合多种反馈类型。目前尚不清楚如何从诸如演示、比较、评级和停止等提供定性不同信号的异构反馈类型中联合学习奖励函数。我们通过将多反馈类型奖励学习建模为对共享潜在奖励函数的贝叶斯推断,其中每种反馈类型通过显式似然函数贡献信息。我们引入一种可扩展的 amortize 变分推断方法,该方法学习共享奖励编码器和反馈特定似然解码器,并通过优化单个证据下界进行训练。我们的做法避免将反馈降级为常见中间表示,无需手动损失平衡。在离散和连续控制基准上,我们展示联合推断得到的奖励后验优于单类型基线,能利用异构反馈类型的互补信息,并产生对环境扰动更稳健的策略。推断得到的奖励不确定性进一步提供了解释性信号,用于分析模型在不同反馈类型上的置信度和一致性。
引用
@article{arxiv.2602.15206,
title = {MAVRL: Learning Reward Functions from Multiple Feedback Types with Amortized Variational Inference},
author = {Raphaël Baur and Yannick Metz and Maria Gkoulta and Mennatallah El-Assady and Giorgia Ramponi and Thomas Kleine Buening},
journal= {arXiv preprint arXiv:2602.15206},
year = {2026}
}
备注
25 pages, 7 figures