中文

FairReason: 在 MLLMs 中平衡推理与社会偏见

人工智能 2025-09-09 v2

摘要

多模态大语言模型(MLLMs)已在广泛的任务和模态上实现最先进的性能。为进一步提升其推理能力,近期研究探索了高级提示方案和后训练微调技术。尽管这些技术改善了逻辑准确性,但经常使模型输出仍然带有显著的社会偏见。厘清推理能力的提升如何与偏差缓解相互作用——以及这两种目标是否固有地相互妥协——因此仍是一个开放且迫在眉睫的研究问题。我们的研究首先在相同的条件下对比三种偏差缓解策略——监督式微调(SFT)、知识蒸馏(KD)和基于规则的强化学习(RL)——建立其基线优势和弱点。基于这些结果,我们在每种方法中变化去偏焦点样本与推理中心样本的比例,绘制出推理与偏差之间的权衡曲线。我们的扫描结果显示出一种一致的 sweet spot:大约 1:4 的比例使用强化学习训练可将偏见得分降低 10%,同时保留 88% 的模型原始推理准确性,为在 MLLMs 中平衡公平性和能力提供了具体指导。

关键词

引用

@article{arxiv.2507.23067,
  title  = {FairReason: Balancing Reasoning and Social Bias in MLLMs},
  author = {Zhenyu Pan and Yutong Zhang and Jianshu Zhang and Haoran Lu and Haozheng Luo and Yuwei Han and Philip S. Yu and Manling Li and Han Liu},
  journal= {arXiv preprint arXiv:2507.23067},
  year   = {2025}
}

备注

Accepted to the Trustworthy FMs workshop in ICCV 2025