基于主动概念瓶颈的可解释奖励建模
机器学习
2025-07-22 v2
摘要
我们引入概念瓶颈奖励模型(CB-RM),一种通过选择性概念标注实现可解释偏好学习的奖励建模框架。不同于依赖不透明奖励函数的标准 RLHF 方法,CB-RM 将奖励预测分解为人类可解释的概念。为使该框架在低监督设置下高效运行,我们形式化了主动学习策略,以动态获取最具信息量的概念标签。我们基于 Expected Information Gain 提出获取函数,实证表明该方法在不牺牲偏好准确性的前提下显著加速概念学习。在 UltraFeedback 数据集上评估后,我们的方法在可解释性和样本效率方面均优于基线方法,标志着向更透明、可审计且符合人类价值观的奖励模型迈出了一步。
引用
@article{arxiv.2507.04695,
title = {Interpretable Reward Modeling with Active Concept Bottlenecks},
author = {Sonia Laguna and Katarzyna Kobalczyk and Julia E. Vogt and Mihaela Van der Schaar},
journal= {arXiv preprint arXiv:2507.04695},
year = {2025}
}