THQA:一个面向数字人说话头视频的感知质量评估数据库
计算机视觉与模式识别
2024-04-16 v1 图像与视频处理
摘要
在媒体技术领域,由于计算机技术的快速发展,数字人日益受到关注。然而,大多数数字人所需的手动建模和控制对高效开发构成了重大障碍。语音驱动的方法为操控数字人的嘴型和表情提供了一条新途径。尽管驱动方法层出不穷,但许多生成的说话头(TH)视频的质量仍然令人担忧,影响了用户的视觉体验。为解决这一问题,本文介绍了说话头质量评估(THQA)数据库,该数据库包含通过 8 种不同语音驱动方法生成的 800 个 TH 视频。大量实验证实了 THQA 数据库在角色和语音特征方面的丰富性。随后的主观质量评估实验分析了评分结果与语音驱动方法、年龄和性别之间的相关性。此外,实验结果表明,主流的图像和视频质量评估方法在 THQA 数据库上存在局限性,这凸显了进一步研究以增强 TH 视频质量评估的必要性。THQA 数据库可在 https://github.com/zyj-2000/THQA 公开获取。
引用
@article{arxiv.2404.09003,
title = {THQA: A Perceptual Quality Assessment Database for Talking Heads},
author = {Yingjie Zhou and Zicheng Zhang and Wei Sun and Xiaohong Liu and Xiongkuo Min and Zhihua Wang and Xiao-Ping Zhang and Guangtao Zhai},
journal= {arXiv preprint arXiv:2404.09003},
year = {2024}
}