解决文本到图像生成中的身份危机
计算机视觉与模式识别
2026-04-02 v3
摘要
最先进的文本到图像模型在生成包含多人的场景时存在持续的身份危机:产生重复面孔、合并身份和误计人数。我们提出了DisCo(基于多样性约束的强化学习,Reinforcement with Diversity Constraints),一种直接优化图像内部和生成样本组之间身份多样性的强化学习框架。DisCo使用组相对策略优化(GRPO)对流匹配模型进行微调,其组合奖励函数:(i) 惩罚图像内的面部相似性,(ii) 抑制跨样本的身份重复,(iii) 强制准确的人数统计,(iv) 通过人类偏好评分保持视觉保真度和提示对齐。单一阶段课程随着提示复杂度的增加稳定训练。重要的是,该方法不需要任何真实数据。在DiverseHumans测试集上,DisCo实现了98.6%的独特面孔准确率和接近完美的全局身份扩散,超越了开源和专有模型(如Gemini、GPT-Image),同时保持了感知质量。我们的结果确立了跨样本多样性作为解决身份崩溃的关键轴,使DisCo成为多人类图像合成的可扩展、无标注解决方案。
引用
@article{arxiv.2510.01399,
title = {Resolving the Identity Crisis in Text-to-Image Generation},
author = {Shubhankar Borse and Farzad Farhadzadeh and Munawar Hayat and Fatih Porikli},
journal= {arXiv preprint arXiv:2510.01399},
year = {2026}
}
备注
Accepted to CVPR 2026