中文

StreamChar:解耦编排下的长时程流式人物音视频生成

计算机视觉与模式识别 2026-05-26 v1

摘要

实时流式联合音视频生成对于人物动画需要满足以下要求:生成器必须按指定文本发音,保持跨块的视觉身份一致性,并且在严格的播放预算内运行。这些要求同时满足极具挑战性:块级自回归生成会导致文本-音频错位和视觉漂移,而实现低延迟所需的few-step蒸馏往往会降低空间多样性和时序质量。我们提出StreamChar,一个将长时程编排与短窗口音视频去噪分离的流式框架。基于文本和历史语境的LLM编排器生成帧对齐的音频条件,联合音视频DiT进行局部双向去噪,利用reference和motion-frame conditioning。为高效部署,我们采用两阶段蒸馏管线:首先压缩采样器,然后在在线块滚动中进行学生模型微调。进度感知指针将部分文本与生成音频对齐,sink-chunk记忆为减少长时程漂移提供持久的视觉锚点。短片段和长时程协议上的实验表明,StreamChar在单张H100 GPU上实现实时运行,相较于最新的联合和音频驱动基线,在文本忠实度、音视频同步、视觉质量和流式稳定性方面实现了有利的系统级权衡。

关键词

引用

@article{arxiv.2605.25659,
  title  = {StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration},
  author = {Linrui Tian and Qi Wang and Bang Zhang},
  journal= {arXiv preprint arXiv:2605.25659},
  year   = {2026}
}