面向音频驱动说话人头 Synthesize 的大规模多样化数据集 TalkVid
计算机视觉与模式识别
2025-08-20 v1
摘要
音频驱动的说话人头合成已实现惊人的逼真度,但最先进(SOTA)模型存在一个关键问题:缺乏对人类在族裔、语言和年龄群体中全谱系多样性的泛化。我们认为,这种泛化差距直接源于现有训练数据的局限——规模、质量和多样性不足。为此,我们引入 TalkVid,一个新的大规模、高质量且多样化的数据集,包含来自 7729 位独特说话者的 1244 小时的视频。TalkVid 通过一套原则性、多阶段的自动化管道进行筛选,严格控制运动稳定性、审美质量和面部细节,并通过人类判断验证确保其可靠性。此外,我们构建并发布了 TalkVid-Bench,一个由 500 条精心挑选的片段组成的分层评估集,均在关键人口统计学和语言轴向上得到严格平衡。我们的实验表明,在 TalkVid 上训练的模型优于先前数据集上的对手,显示出卓越的跨数据集泛化能力。关键的是,我们在 TalkVid-Bench 上的分析揭示了传统聚合指标掩盖的子群体间性能差异,凸显了其对未来研究的必要性。代码和数据可在 https://github.com/FreedomIntelligence/TalkVid 找到。
引用
@article{arxiv.2508.13618,
title = {TalkVid: A Large-Scale Diversified Dataset for Audio-Driven Talking Head Synthesis},
author = {Shunian Chen and Hejin Huang and Yexin Liu and Zihan Ye and Pengcheng Chen and Chenghao Zhu and Michael Guan and Rongsheng Wang and Junying Chen and Guanbin Li and Ser-Nam Lim and Harry Yang and Benyou Wang},
journal= {arXiv preprint arXiv:2508.13618},
year = {2025}
}