中文

FairHuman:在扩散模型中利用最小潜在延迟公平性提升人物图像生成中的手部和面部质量

计算机视觉与模式识别 2025-07-04 v1 人工智能

摘要

随着大规模文本到图像模型,特别是基于扩散的模型的发展,图像生成取得了显著进展。然而,生成具有合理细节(如面部或手部)的人物图像仍然具有挑战性,原因在于训练期间对局部区域的监督不足。为了解决这个问题,我们提出了FairHuman,一种多目标微调方法,旨在公平地提升全局和局部生成质量。具体来说,我们首先构建了三个学习目标:一个源自默认扩散目标函数的全局目标,以及两个基于预标注位置先验的手部和面部局部目标。随后,我们在最小潜在延迟(MPD)准则的指导下推导出最优参数更新策略,从而实现对这一多目标问题的公平感知优化。基于此,我们提出的方法能够在保持整体质量的同时,在生成具有挑战性的局部细节方面取得显著改进。大量实验展示了我们的方法在不同场景下提升人物图像生成性能的有效性。

关键词

引用

@article{arxiv.2507.02714,
  title  = {FairHuman: Boosting Hand and Face Quality in Human Image Generation with Minimum Potential Delay Fairness in Diffusion Models},
  author = {Yuxuan Wang and Tianwei Cao and Huayu Zhang and Zhongjiang He and Kongming Liang and Zhanyu Ma},
  journal= {arXiv preprint arXiv:2507.02714},
  year   = {2025}
}

备注

ICCV 2025