评估与预测人工智能生成图像中的畸变人体部位
摘要
近期文本到图像 (T2I) 模型的快速发展使得高质量图像合成成为可能,但生成具有解剖学准确性的人体图形仍然具有挑战性。AI 生成的图像常常会出现四肢增生、指部缺失、四肢变形或身体部位融合等畸变现象。现有的评估指标,如 Inception Score (IS) 和 Fr\'echet Inception Distance (FID),缺乏检测这些畸变所需的细粒度能力,而人类偏好基于指标则关注的是抽象的质量评估,而非解剖学忠实性。为此,我们首次建立了人体畸变在AI生成图像中识别的标准,引入 Distortion-5K 数据集,包含 4700 幅标注好的常规及畸形人体图形,涵盖多种风格和畸变类型。基于该数据集,我们提出了 ViT-HD 模型,即基于 Vision Transformer 的模型,专为检测AI生成图像中的人体畸变而设计,该模型在畸变定位任务上超越了当前最先进的分割模型和视觉语言模型,实现 F1 分数为 0.899,IoU 为 0.831。此外,我们构建了 Human Distortion Benchmark 数据集,包含 500 个以人为中心的提示词,用于评估四个流行 T2I 模型。我们的研究发现,近 50% 的生成图像包含畸变。这一工作为系统性地评估AI生成人类的解剖学准确性开辟了道路,为提升 T2I 模型的真实世界应用提供了工具。Distortion-5K 数据集以及训练好的 ViT-HD 将很快发布在我们的 GitHub 仓库中:\href{https://github.com/TheRoadQaQ/Predicting-Distortion}{https://github.com/TheRoadQaQ/Predicting-Distortion}。
引用
@article{arxiv.2503.00811,
title = {Evaluating and Predicting Distorted Human Body Parts for Generated Images},
author = {Lu Ma and Kaibo Cao and Hao Liang and Jiaxin Lin and Zhuang Li and Yuhong Liu and Jihong Zhang and Wentao Zhang and Bin Cui},
journal= {arXiv preprint arXiv:2503.00811},
year = {2025}
}
备注
8 pages, 6 figures