中文

DyStream:基于流匹配自回归模型的流式双人对话头像生成

计算机视觉与模式识别 2026-02-03 v2

摘要

生成逼真的双人对话头像视频需要超低延迟。现有的基于块的方法需要完整的非因果上下文窗口,会引入显著延迟。这种高延迟严重阻碍了逼真听者所需的即时非语言反馈。为解决此问题,我们提出 DyStream,一种基于流匹配的自回归模型,能够根据说话者和听者的音频实时生成视频。我们的方法包含两个关键设计:(1) 采用流友好的自回归框架,并配备流匹配头进行概率建模;(2) 提出一种由前瞻模块增强的因果编码器,以纳入短时未来上下文(例如 60 毫秒),在保持低延迟的同时提升质量。我们的分析表明,这种简单有效的方法显著优于其他因果策略,包括蒸馏和生成式编码器。大量实验表明,DyStream 能以每帧 34 毫秒的速度生成视频,保证整个系统延迟低于 100 毫秒。此外,它在唇同步质量上达到了最先进水平,在 HDTF 数据集上的离线和在线 LipSync Confidence 分数分别为 8.13 和 7.61。模型、权重和代码均已公开。

关键词

引用

@article{arxiv.2512.24408,
  title  = {DyStream: Streaming Dyadic Talking Heads Generation via Flow Matching-based Autoregressive Model},
  author = {Bohong Chen and Haiyang Liu},
  journal= {arXiv preprint arXiv:2512.24408},
  year   = {2026}
}

备注

Project Page: https://robinwitch.github.io/DyStream-Page