谁是更好的说话者:AI 生成说话头的主观与客观质量评估
计算机视觉与模式识别
2025-08-01 v1 图像与视频处理
摘要
肖像的语音驱动方法因其能够合成说话嘴型和面部运动,被形象地称为“说话者”。特别是随着文本到图像 (T2I) 模型的快速发展,AI 生成说话头 逐渐成为一种新兴的数字人媒体。然而,这些说话者及其生成的 AGTH 的质量方面仍存在挑战,且针对这些问题的综合性研究仍然有限。为填补这一空白,本文提出了迄今为止最大的 AGTH 质量评估数据集 THQA-10K,该数据集选取了 12 个主流 T2I 模型和 14 个先进的说话者,针对 14 个提示词生成 AGTH。在排除 AGTH 生成失败的实例后,THQA-10K 数据集包含 10,457 个 AGTH。随后,招募志愿者对 AGTH 进行主观评分并给出相应的失真类别。在对主观实验结果的分析中,我们从泛化能力和质量方面评估了说话者的性能,并揭示了现有 AGTH 的失真问题。最后,提出了一种基于首帧、Y-T 切片和语调-唇部一致性的客观质量评估方法。实验结果表明,该方法在 AGTH 质量评估中能够达到最先进 的性能。该工作发布于 https://github.com/zyj-2000/Talker。
引用
@article{arxiv.2507.23343,
title = {Who is a Better Talker: Subjective and Objective Quality Assessment for AI-Generated Talking Heads},
author = {Yingjie Zhou and Jiezhang Cao and Zicheng Zhang and Farong Wen and Yanwei Jiang and Jun Jia and Xiaohong Liu and Xiongkuo Min and Guangtao Zhai},
journal= {arXiv preprint arXiv:2507.23343},
year = {2025}
}