SpeakerVid-5M:面向音视频双人交互人类生成的大规模高质量数据集
计算机视觉与模式识别
2025-07-15 v1 音频与语音处理
摘要
大规模模型的快速发展催化了数字人领域的重大突破。这些先进方法为人格驱动和渲染提供了高保真解决方案,导致学术界关注下一个重大挑战:音视频双人交互式虚拟人类。为促进该新兴领域的研究,我们提出 SpeakerVid-5M 数据集,这是第一个大规模、高质量的数据集,专为音视频双人交互式虚拟人类生成而设计。SpeakerVid-5M 总计超过 8743 小时,包含超过 520 万段人物肖像视频。它涵盖多样化的规模和交互类型,包括单人讲话、倾听和双人对话。关键的是,该数据集在两个关键维度上进行结构化:一是交互类型,二是数据质量。首先,根据交互场景将其划分为四类(对话分支、单分支、倾听分支和多轮分支)。其次,将其分为大规模预训练子集和面向监督微调(SFT)的精选高质量子集。这一双重结构 accommodate 了广泛的 2D 虚拟人任务。此外,我们提供了一个基于自回归(AR)的视频聊天基线模型,配备一套专属指标和测试数据,作为 VidChatBench 为未来工作提供基准。数据集和相应的数据处理代码将公开释放。项目页面: https://dorniwang.github.io/SpeakerVid-5M/。
引用
@article{arxiv.2507.09862,
title = {SpeakerVid-5M: A Large-Scale High-Quality Dataset for Audio-Visual Dyadic Interactive Human Generation},
author = {Youliang Zhang and Zhaoyang Li and Duomin Wang and Jiahe Zhang and Deyu Zhou and Zixin Yin and Xili Dai and Gang Yu and Xiu Li},
journal= {arXiv preprint arXiv:2507.09862},
year = {2025}
}