中文

LMME3DHF:基于大型多模态模型对 3D 人类面部生成进行基准测试与评估

计算机视觉与模式识别 2025-08-06 v3

摘要

生成式人工智能的快速发展已使能够创建 3D 人类面部 (HFs) 成为可能,广泛应用于媒体制作、虚拟现实、安防、医疗和游戏开发等领域。然而,评估这些人工智能生成的 3D 人类面部的质量与真实性仍是一个显著挑战,由于人类感知的主观性以及对面部特征的天然感知敏感性。为此,我们对 AI 生成的 3D 人类面部质量评估开展了全面研究。我们首先引入 Gen3DHF,一个大型基准数据集,包含 2000 份 AI 生成的 3D 人类面部视频,以及跨两个维度(即质量与真实性)收集的 4000 项平均意见分数 (MOS),并伴随 2000 项失真感知地图与失真描述。基于 Gen3DHF,我们提出 LMME3DHF,即一种基于大型多模态模型 (LMM) 的指标,用于评估 3DHF,具备质量与真实性得分预测、失真感知视觉问答与失真感知图预测能力。实验结果表明,LMME3DHF 实现了最先进的性能,在准确预测 AI 生成的 3D 人类面部质量得分、有效识别失真感知显著区域与失真类型方面均优于现有方法,同时保持与人类感知判断的强对齐。Gen3DHF 数据集与 LMME3DHF 将在论文发布后公开。

关键词

引用

@article{arxiv.2504.20466,
  title  = {LMME3DHF: Benchmarking and Evaluating Multimodal 3D Human Face Generation with LMMs},
  author = {Woo Yi Yang and Jiarui Wang and Sijing Wu and Huiyu Duan and Yuxin Zhu and Liu Yang and Kang Fu and Guangtao Zhai and Xiongkuo Min},
  journal= {arXiv preprint arXiv:2504.20466},
  year   = {2025}
}