面向人脸视频质量评估的大规模数据集与基于 LMM 的方法
计算机视觉与模式识别
2025-10-07 v2
摘要
面向人脸视频质量评估 (FVQA) 的探索值得进一步考察,因为人脸视频是社交媒体平台上的主要内容,人类视觉系统 (HVS) 对人脸特别敏感。然而,由于缺乏大规模 FVQA 数据集,FVQA 鲜有被探索。为填补这一空白,我们提出了首个大规模野生人脸视频质量评估数据集 FVQ-20K,包含 20,000 个野生人脸视频及其对应的平均意见分数 (MOS) 标注。搭载 FVQ-20K 数据集,我们进一步提出了一种专门的 FVQA 方法 FVQ-Rater,以实现类人评级和评分,这是首次尝试探索大型多模态模型 (LMM) 用于 FVQA 任务。具体而言,我们精心提取包括空间特征、时间特征和面孔特定特征 (即肖像特征和人脸嵌入) 的多维特征,以提供全面的视觉信息,并利用 LoRA-based instruction tuning 技术实现质量特定的微调,在 FVQ-20K 和 CFVQA 数据集上均表现出优异性能。广泛的实验和全面的分析表明,FQV-20K 数据集和 FVQ-Rater 方法在推动 FVQA 领域发展方起到了显著作用。
引用
@article{arxiv.2504.09255,
title = {FVQ: A Large-Scale Dataset and an LMM-based Method for Face Video Quality Assessment},
author = {Sijing Wu and Yunhao Li and Ziwen Xu and Yixuan Gao and Huiyu Duan and Wei Sun and Guangtao Zhai},
journal= {arXiv preprint arXiv:2504.09255},
year = {2025}
}
备注
Accepted by ACM MM 2025. Project page: https://github.com/wsj-sjtu/FVQ