中文

从文本到图像模型中检测人类残留物

计算机视觉与模式识别 2025-03-11 v2

摘要

尽管近期取得了进展,文本到图像生成模型常常产生包含人类身体部位的残留物的图像。这些残留物表现为 poorly 生成的人类身体,包括变形、缺失或多余的身体部位,导致与典型人类解剖结构之间的视觉不一致,严重影响整体保真度。在本研究中,我们解决了这个挑战,通过构建 Human Artifact Dataset (HAD),一个专为 localizing 人类残留物而设计的多样化数据集。HAD 包含来自几个流行文本到图像模型生成的超过 37,000 张图像,标注了人类残留物的 localizing。使用该数据集,我们训练了 Human Artifact Detection Models (HADM),这些模型可以识别跨多个生成领域的不同残留物,并在来自未见生成器的图像上表现出强大的泛化能力。此外,为了进一步提高生成器对人类结构一致性的感知,我们将我们的 HADM 预测用作反馈,用于扩散模型的 fine-tuning。我们的实验确认了结果模型中人类残留物的减少。此外,我们展示了 HADM 在迭代填充框架中检测人类残留物的新颖应用,用于直接纠正任意图像中的人类残留物,证明了其在提高图像质量方面的实用性。我们的数据集和检测模型可在 https://github.com/wangkaihong/HADM 获取。

关键词

引用

@article{arxiv.2411.13842,
  title  = {Detecting Human Artifacts from Text-to-Image Models},
  author = {Kaihong Wang and Lingzhi Zhang and Jianming Zhang},
  journal= {arXiv preprint arXiv:2411.13842},
  year   = {2025}
}