BodyMetric:评估文本到图像生成中人类身体的真实性
计算机视觉与模式识别
2024-12-09 v2 人工智能
摘要
准确地从文本生成人类身体图像始终是文本到图像模型面临的挑战问题。常见的身体相关artifact包括多余或缺失的四肢、不真实的姿态、模糊的身体部位等。目前,评估此类artifact依赖大量耗时的主观判断,限制了大规模模型基准测试的能力。我们通过提出BodyMetric,一种可学习的指标来预测图像中身体的真实性。BodyMetric在真实性标签和多模态信号(包括从输入图像推断的3D身体表示以及文本描述)上进行训练。为支持这一方法,我们设计了 annotation pipeline 来收集专家对人类身体真实性的评级,从而构建了一个用于此任务的新数据集,称为BodyRealism。消融研究支持我们对BodyMetric的架构选择,以及在捕捉2D图像中身体相关artifact方面利用3D人类身体先验的重要性。与评估通用用户偏好的concurrent指标不同,BodyMetric具体反映身体相关的artifact。我们通过展示BodyMetric在之前不可大规模应用中的实用性。特别是,我们使用BodyMetric来基准测试文本到图像模型生成真实人类身体的能力。我们还展示了BodyMetric在基于预测的真实性评分对生成图像进行排序方面的有效性。
引用
@article{arxiv.2412.04086,
title = {BodyMetric: Evaluating the Realism of Human Bodies in Text-to-Image Generation},
author = {Nefeli Andreou and Varsha Vivek and Ying Wang and Alex Vorobiov and Tiffany Deng and Raja Bala and Larry Davis and Betty Mohler Tesch},
journal= {arXiv preprint arXiv:2412.04086},
year = {2024}
}