中文

使用强化学习反馈消除图像生成模型中的刻板印象偏差

计算机视觉与模式识别 2024-07-16 v1 人工智能 机器学习

摘要

本研究利用基于人工智能反馈的强化学习 (RLAIF) 方法,针对图像生成模型中的性别偏见问题,提出了一种 novel 的去噪扩散策略优化 (Denoising Diffusion Policy Optimization, DDPO) 流程。通过采用预训练的 stable diffusion 模型和高度精准的性别分类 Transformer,研究引入了两种奖励函数:Rshift 用于调整性别不平衡,Rbalance 用于实现并维持性别平衡。实验结果表明,该方法在不损害图像质量、无需额外数据或提示修改的情况下,有效缓解了偏见。虽然本文聚焦于性别偏见,但该工作为解决 AI 系统中的各种偏见问题奠定了基础,强调了负责任 AI 开发的必要性。未来研究方向包括将方法扩展到其他偏见类型、增强 RLAIF 流程的鲁棒性,以及探索多提示微调,以进一步推动 AI 中的公平性和包容性。

关键词

引用

@article{arxiv.2407.09551,
  title  = {Diminishing Stereotype Bias in Image Generation Model using Reinforcemenlent Learning Feedback},
  author = {Xin Chen and Virgile Foussereau},
  journal= {arXiv preprint arXiv:2407.09551},
  year   = {2024}
}