中文

基于主动概念瓶颈的可解释奖励建模

机器学习 2025-07-22 v2

摘要

我们引入概念瓶颈奖励模型(CB-RM),一种通过选择性概念标注实现可解释偏好学习的奖励建模框架。不同于依赖不透明奖励函数的标准 RLHF 方法,CB-RM 将奖励预测分解为人类可解释的概念。为使该框架在低监督设置下高效运行,我们形式化了主动学习策略,以动态获取最具信息量的概念标签。我们基于 Expected Information Gain 提出获取函数,实证表明该方法在不牺牲偏好准确性的前提下显著加速概念学习。在 UltraFeedback 数据集上评估后,我们的方法在可解释性和样本效率方面均优于基线方法,标志着向更透明、可审计且符合人类价值观的奖励模型迈出了一步。

关键词

引用

@article{arxiv.2507.04695,
  title  = {Interpretable Reward Modeling with Active Concept Bottlenecks},
  author = {Sonia Laguna and Katarzyna Kobalczyk and Julia E. Vogt and Mihaela Van der Schaar},
  journal= {arXiv preprint arXiv:2507.04695},
  year   = {2025}
}