TalkVerse: democratizing minute-long audio-driven video generation
计算机视觉与模式识别
2025-12-18 v1 人工智能
多媒体
声音
摘要
我们介绍 TalkVerse,这是一个大规模开放语料库,用于单人、音频驱动的说话视频生成,旨在实现方法间的公平、可重复比较。虽然当前最先进系统依赖封闭数据或计算密集型模型,但 TalkVerse 提供 230 万个高分辨率 (720p/1080p) 音视频同步剪辑,总时长达 6300 小时。这些数据通过透明的管道筛选而来,包括场景切断检测、审美评估、严格的音视频同步检查以及全面的注释,包括 2D 骨架和结构化视觉/音频风格标题。利用 TalkVerse,我们构建了一个基于 Wan2.2-5B 的可复现 50 亿参数 DiT 基线。通过采用高下采样率的视频 VAE 和带动作帧上下文的滑动窗口机制,我们的模型实现了分钟级生成,漂移误差极低。其在同步与视觉质量方面与 140 亿参数 Wan-S2V 模型相当,却推理成本降低 10 倍。为提升长视频的叙事能力,我们集成了 MLLM 导演,通过音频和视觉线索重写提示词。此外,我们的模型支持通过受控潜在噪声注入实现零样本视频配音。我们开源数据集、训练配方以及 50 亿参数模型检查点,以降低音频驱动人类视频生成研究的门槛。项目页面:https://zhenzhiwang.github.io/talkverse/
引用
@article{arxiv.2512.14938,
title = {TalkVerse: Democratizing Minute-Long Audio-Driven Video Generation},
author = {Zhenzhi Wang and Jian Wang and Ke Ma and Dahua Lin and Bing Zhou},
journal= {arXiv preprint arXiv:2512.14938},
year = {2025}
}
备注
open-sourced single-person full-body talking video generation dataset, training code and checkpoints