中文

SoulX-FlashHead:面向无限实时流媒体说话人化的Oracle引导生成

计算机视觉与模式识别 2026-02-12 v3

摘要

在音频驱动的人像生成中,实现高保真视觉质量与低延迟流式传输之间的平衡仍是一个巨大的挑战。现有的大规模模型通常面临计算成本的高企,而轻量级替代方案则通常在整体面部表征和时序稳定性方面受到妥协。在本文中,我们提出了SoulX-FlashHead,一个为实现实时、无限长度和高保真流式视频生成而设计的统一13亿参数框架。为解决流式场景中音频特征不稳定的问题,我们引入了面向流式的时空预训练,并配备了时序音频上下文缓存机制,确保从短音频片段中进行稳健的特征提取。此外,为缓解在长序列自回归生成中所特有的误差累积和身份漂移问题,我们提出了Oracle引导的双向蒸馏,利用真实运动先验提供精确的物理指导。我们还 presented了一个大规模高质量数据集VividHead,包含782小时严格对齐的素材以支持稳健的训练。广泛的实验表明,SoulX-FlashHead在HDTF和VFHQ基准测试中实现了最佳性能。值得注意的是,我们的Lite变体在单张NVIDIA RTX 4090上实现了96 FPS的推理速度,实现了在不牺牲视觉连贯性的前提下实现超高速交互。

关键词

引用

@article{arxiv.2602.07449,
  title  = {SoulX-FlashHead: Oracle-guided Generation of Infinite Real-time Streaming Talking Heads},
  author = {Tan Yu and Qian Qiao and Le Shen and Ke Zhou and Jincheng Hu and Dian Sheng and Bo Hu and Haoming Qin and Jun Gao and Changhai Zhou and Shunshun Yin and Siyuan Liu},
  journal= {arXiv preprint arXiv:2602.07449},
  year   = {2026}
}

备注

11 pages, 3 figures