FairCoT: 通过链式思维推理提升文本到图像生成中的公平性
机器学习
2025-09-16 v4 人工智能
计算机视觉与模式识别
摘要
在文本到图像生成模型领域,训练数据集中固有的偏见常会传递到生成内容中,这在社交敏感情境下提出了重大的伦理挑战。我们引入 FairCoT,一种通过链式思维 (CoT) 推理于多模态生成式大语言模型中提升文本到图像模型公平性的新框架。FairCoT 采用迭代式 CoT 推理,以系统性地缓解偏见,并在实时动态调整文本提示,确保生成图像中呈现出多样且平等的表征。通过集成迭代推理过程,FairCoT 解决了零样图 CoT 在敏感情境中的局限性,在平衡创造力与伦理责任之间取得平衡。跨越包括 DALLE 以及各种 Stable Diffusion 变体等流行文本到图像系统的实验评估表明,FairCoT 在不牺牲图像质量或语义忠实度的前提下,显著提升了公平性和多样性。凭借稳健的推理、轻量级部署以及对多种模型的可扩展性,FairCoT 表示了通向更具社会责任感和透明度的 AI 驱动内容生成的有前景的一步。
引用
@article{arxiv.2406.09070,
title = {FairCoT: Enhancing Fairness in Text-to-Image Generation via Chain of Thought Reasoning with Multimodal Large Language Models},
author = {Zahraa Al Sahili and Ioannis Patras and Matthew Purver},
journal= {arXiv preprint arXiv:2406.09070},
year = {2025}
}
备注
Accepted at EMNLP 2025