DH-FaceVid-1K:面部视频生成的大规模高质量数据集
计算机视觉与模式识别
2025-07-15 v2
摘要
以人为中心的生成模型正日益流行,催生出各种创新工具和应用,例如基于文本或音频提示生成说话人脸视频。这些能力的核心在于强大的预训练基础模型,这些模型是在大规模高质量数据集上训练的。然而,许多先进方法依赖内部数据,受到各种约束;而其他当前研究则未能生成高分辨率的人脸视频,这主要归因于缺乏大规模高质量的人脸视频数据集。本文介绍了一个人脸视频数据集,\textbf{DH-FaceVid-1K}。该数据集总计覆盖1,200小时,包含来自20,000多名个体的270,043个视频片段。每个样本均包含相应的语音音频、面部关键点和文本标注。与其他公开数据集相比,我们的数据集在多民族覆盖和高质量、全面的个体属性方面具有显著优势。我们建立了多个支持文本到视频和图像到视频生成等任务的人脸视频生成模型。此外,我们开发了综合性基准测试,以验证在使用不同比例本数据集时,其规模规律。我们的主要目标是提供一个人脸视频数据集,特别是针对现有精选数据集中亚洲人脸的代表性不足,丰富全球人脸导向数据的光谱,并缓解人口统计学偏见。\textbf{项目页面:}https://luna-ai-lab.github.io/DH-FaceVid-1K/
引用
@article{arxiv.2410.07151,
title = {DH-FaceVid-1K: A Large-Scale High-Quality Dataset for Face Video Generation},
author = {Donglin Di and He Feng and Wenzhang Sun and Yongjia Ma and Hao Li and Wei Chen and Lei Fan and Tonghua Su and Xun Yang},
journal= {arXiv preprint arXiv:2410.07151},
year = {2025}
}