TalkCuts:用于多镜头人类语音视频生成的大规模数据集
计算机视觉与模式识别
2025-10-14 v2
摘要
本工作提出TalkCuts,一个大规模数据集,旨在促进多镜头人类语音视频生成的研究。与现有专注于单镜头、静态视角的数据集不同,TalkCuts提供164k个片段,总时长超过500小时的高质量人类语音视频,包含多样化的摄像机镜头,包括特写、半身和全身视角。数据集包括详细的文本描述、2D关键点和3D SMPL-X运动标注,覆盖超过10k个身份,使其能够实现多模态学习和评估。作为首次展示数据集价值的尝试,我们呈现了Orator,一个由LLM引导的多模态生成框架作为简单基线,其中语言模型作为多面向导演,协调相机转换、说话人手势和声音调制的详细规格。该架构使能够通过集成的多模态视频生成模块合成连贯的长篇视频。在姿态引导和音频驱动设置中的大量实验表明,在TalkCuts上进行训练显著增强了生成多镜头语音视频的电影摄影连贯性和视觉吸引力。我们认为TalkCuts为未来的可控、多镜头语音视频生成以及更广泛的多模态学习提供了坚实的基础。
引用
@article{arxiv.2510.07249,
title = {TalkCuts: A Large-Scale Dataset for Multi-Shot Human Speech Video Generation},
author = {Jiaben Chen and Zixin Wang and Ailing Zeng and Yang Fu and Xueyang Yu and Siyuan Cen and Julian Tanke and Yihang Chen and Koichi Saito and Yuki Mitsufuji and Chuang Gan},
journal= {arXiv preprint arXiv:2510.07249},
year = {2025}
}
备注
Project page: https://talkcuts.github.io/