音频驱动说话人头视频感知质量指标的对比研究
计算机视觉与模式识别
2024-03-12 v1
摘要
人工智能生成内容 (AIGC) 技术的快速发展推动了音频驱动说话人头生成,在实际应用中获得了极大的研究关注。然而,性能评估研究落后于说话人头生成技术的发展。现有文献依赖于缺乏人类验证的启发式定量指标,阻碍了准确的进展评估。为了弥补这一空白,我们收集了由四种生成方法生成的说话人头视频,并在视觉质量、唇音同步性和头部运动自然度方面进行了受控的心理物理学实验。我们的实验验证了模型预测与人类标注之间的一致性,并识别出比广泛使用的度量标准更符合人类观点的指标。我们相信我们的工作将促进性能评估和模型开发,并在更广泛的背景下为 AIGC 提供见解。代码和数据将发布于 https://github.com/zwx8981/ADTH-QA。
引用
@article{arxiv.2403.06421,
title = {A Comparative Study of Perceptual Quality Metrics for Audio-driven Talking Head Videos},
author = {Weixia Zhang and Chengguang Zhu and Jingnan Gao and Yichao Yan and Guangtao Zhai and Xiaokang Yang},
journal= {arXiv preprint arXiv:2403.06421},
year = {2024}
}