REST:通过ID上下文缓存与异步流蒸馏实现基于扩散的实时端到端流式说话头生成
计算机视觉与模式识别
2026-01-30 v3 声音
摘要
扩散模型显著推动了说话头生成(THG)领域的发展。然而,缓慢的推理速度和普遍存在的非自回归范式严重限制了基于扩散的THG模型的应用。在本研究中,我们提出了REST,一个开创性的基于扩散的、实时的、端到端的流式音频驱动说话头生成框架。为支持实时端到端生成,首先通过具有高压缩率的时空变分自编码器学习一个紧凑的视频潜在空间。此外,为在紧凑视频潜在空间中实现半自回归流式传输,我们引入了一个ID上下文缓存机制,将ID-Sink和上下文缓存原理集成到键值缓存中,以在长期流式生成过程中保持身份一致性和时间一致性。此外,提出了一种异步流蒸馏(ASD)策略,通过使用具有异步噪声调度器的非流式教师来监督流式学生,以减轻误差累积并增强流式生成中的时间一致性。REST弥合了自回归方法与基于扩散的方法之间的差距,为需要实时THG的应用实现了效率上的突破。实验结果表明,REST在生成速度和整体性能方面均优于最先进的方法。
引用
@article{arxiv.2512.11229,
title = {REST: Diffusion-based Real-time End-to-end Streaming Talking Head Generation via ID-Context Caching and Asynchronous Streaming Distillation},
author = {Haotian Wang and Yuzhe Weng and Jun Du and Haoran Xu and Xiaoyan Wu and Shan He and Bing Yin and Cong Liu and Qingfeng Liu},
journal= {arXiv preprint arXiv:2512.11229},
year = {2026}
}
备注
27 pages, 10 figures