中文

SoulX-FlashTalk:基于自校正双向蒸馏实现音频驱动 Avatar 实时无限流

计算机视觉与模式识别 2026-01-07 v3 人工智能

摘要

为实现基于大型扩散模型的实时、无限时长、音频驱动的头像生成,面临计算负载与严格延迟限制之间的冲突。现有方法常通过强制单向注意力机制或降低模型容量来牺牲视觉保真度。为解决此问题,我们引入了 SoulX-FlashTalk,一个 14B 参数的框架,专为高保真实时流优化。不同于常规单向范式,我们采用自校正双向蒸馏策略,在视频块内保留双向注意力。该设计保留关键时空相关性,显著提升运动连贯性和视觉细节。为确保无限生成期间的稳定性,我们引入了多步骤回溯自校正机制,使模型能够自主恢复累积误差,防止崩溃。此外,我们构建了一整套推理加速方案,集成混合序列并行、并行 VAE 和内核级优化。广泛的评估表明,SoulX-FlashTalk 是首个实现亚秒启动延迟(0.87 秒)且实现 32 FPS 实时吞吐的 14B 规模系统,为高保真交互式数字人类合成树立了新标准。

关键词

引用

@article{arxiv.2512.23379,
  title  = {SoulX-FlashTalk: Real-Time Infinite Streaming of Audio-Driven Avatars via Self-Correcting Bidirectional Distillation},
  author = {Le Shen and Qian Qiao and Tan Yu and Ke Zhou and Tianhang Yu and Yu Zhan and Zhenjie Wang and Ming Tao and Shunshun Yin and Siyuan Liu},
  journal= {arXiv preprint arXiv:2512.23379},
  year   = {2026}
}

备注

12 pages, 6 figures