多模态强化学习中用于偏差缓解的对照奖励模型训练
机器学习
2025-08-28 v1
摘要
在基于人类反馈的强化学习(RLHF)中,奖励模型可以高效地学习并放大多模态数据集中的潜在偏差,这可能通过有缺陷的奖励信号导致不完美的策略优化并降低公平性。偏差缓解研究通常采用被动约束,这在因果混淆下可能失效。这里,我们提出了一种对照奖励模型,引入因果推理与多模态表征学习来提供无监督的、抗偏差的奖励信号。我们的贡献核心是对照信任分数(Counterfactual Trust Score),一个由四个组成部分的聚合分数:(1)对照偏移,将政治框架偏差与主题偏差分解;(2)对照扰动期间的重建不确定性;(3)每个受保护属性的公平规则可证明违反;(4)与动态信任度量对齐的时间奖励偏移。我们在多模态真假新闻数据集上评估了该框架,该数据集表现出框架偏差、类别不平衡和分布漂移。借鉴基于表征距离的类似无监督漂移检测方法[1]和语言模型中的时间鲁棒性基准测试方法[2],我们还在连续批次中注入合成偏差以测试鲁棒性。结果系统在真假新闻检测中达到了 89.12% 的准确率,优于基线奖励模型。更重要的是,它减少了虚假相关和不公平强化信号。该流程概述了一种鲁棒且可解释的公平感知 RLHF 方法,提供了可调的偏差减少阈值,并提高了动态实时策略制定中的可靠性。
引用
@article{arxiv.2508.19567,
title = {Counterfactual Reward Model Training for Bias Mitigation in Multimodal Reinforcement Learning},
author = {Sheryl Mathew and N Harshit},
journal= {arXiv preprint arXiv:2508.19567},
year = {2025}
}