中文

通过合成局部偏好实现解剖学上合理的人像生成

计算机视觉与模式识别 2026-05-26 v1

摘要

大规模文本到图像基础模型已实现卓越的视觉逼真度,但生成具有正确解剖结构的人像仍具有挑战性。现有方法通过特定部件模块或在高质量人类照片上的监督微调中采用局部损失加权来强制执行解剖约束,但此类数据集有限且常因光照、姿势和背景等混杂因素提供模糊的优化信号。基于偏好的排序方法提供了另一种选择,但标准的Direct Preference Optimization (DPO) 对所有像素相等地处理,因而未能利用解剖artifact的局部性。为此,我们提出Alignment via Synthetic Anatomical Preference (ASAP) 框架,通过应用于高保真人类照片上的局部退化机制构建受控偏好对。该机制在引入受控解剖错误的区域性显著错误的同时,保留剩余内容。通过该机制,我们创建了包含超过10K对精选数据的Human Anatomical Preference (HAP) 数据集,用于有效的文本到图像人类图像生成模型的解剖对齐。为更好地利用这些受控偏好对的局部性,我们引入了DPO的局部化和边际限制变体,优先针对受目标解剖区域进行优化,同时通过限制有限的偏好边际来防止过度优化并保持全局语义。我们进一步引入HAF-Bench,用于系统评估解剖忠实度。广泛的实验表明,ASAP在多个基础模型上持续减少解剖错误,同时保持整体图像质量。

关键词

引用

@article{arxiv.2605.25759,
  title  = {Towards Anatomically Plausible Human Image Generation via Synthetic Localized Preferences},
  author = {Bao Li and Yuliang Xiu and Zhen Liu},
  journal= {arXiv preprint arXiv:2605.25759},
  year   = {2026}
}