HandEval:生成图像中手部质量评估的初步探索
计算机视觉与模式识别
2025-10-13 v1
摘要
尽管近期的文本到图像(T2I)模型在生成图像的整体视觉质量上已显著提升,但它们在复杂局部区域——尤其是人手——的准确细节生成方面仍然表现不佳。生成的手部常出现结构扭曲和不真实纹理,即使身体其余部分生成良好时也极为显眼。然而,手部区域的质量评估仍被大量忽视,限制了下游任务如以人为中心的生成质量优化和AIGC检测的性能。为解决这一问题,我们提出了首个针对生成手部区域的质量评估任务,并展示了其丰富的下游应用。我们首先引入HandPair数据集用于训练手部质量评估模型。它由48k张图像组成,由高质量和低质量手部配对构成,无需人工标注即可实现低成本高效监督。基于此,我们开发了HandEval,一个精心设计的手部专用质量评估模型。它利用多模态大语言模型(MLLM)的强大视觉理解能力,并融入手部关键点先验知识,从而获得对手部质量的强感知能力。我们进一步构建了一个人工标注的测试集,包含来自多种先进T2I模型的手部图像以验证其质量评估能力。结果表明,HandEval比现有SOTA方法更符合人类判断。此外,我们将HandEval集成到图像生成和AIGC检测流程中,分别显著提升了生成手部的真实感和检测准确率,证实了其在下游应用中的通用有效性。代码和数据集将公开。
引用
@article{arxiv.2510.08978,
title = {HandEval: Taking the First Step Towards Hand Quality Evaluation in Generated Images},
author = {Zichuan Wang and Bo Peng and Songlin Yang and Zhenchen Tang and Jing Dong},
journal= {arXiv preprint arXiv:2510.08978},
year = {2025}
}