Hallo-Live:基于异步双流和人类中心偏好蒸馏的实时流式联合音视频头像生成
计算机视觉与模式识别
2026-04-28 v1 多媒体
声音
摘要
实时文本驱动的联合音视频头像生成需要同步高保真地合成肖像视频和语音,但现有音视频扩散模型速度过慢且在激进加速后常出现质量下降。我们提出 Hallo-Live,一种用于联合音视频头像生成的流式框架,结合了异步双流扩散与人类中心偏好引导蒸馏。为减少因果生成中的 articulation lag,我们引入 Future-Expanding Attention,使每个视频块能够访问同步音频以及未来短期语音线索。为缓解few-step 蒸馏的质量损失,我们进一步提出 Human-Centric Preference-Guided DMD(HP-DMD),通过对视觉保真度、语音自然度和音视频同步性的奖励对训练样本进行重新加权。在两块 NVIDIA H200 GPU 上,Hallo-Live 以 20.38 FPS 的速度运行,延迟仅 0.94 秒,吞吐量是教师模型 Ovi 的 16 倍,延迟降低了 99.3 倍。尽管如此加速,仍保持强大的生成质量,达到与教师模型相当的 VideoAlign 总体得分和 Sync Confidence 得分,同时在整体质量-效率权衡上超越其他加速基线。定性结果进一步表明其在 photorealistic、multi-speaker 和 stylized 场景中具备稳健的泛化能力。鉴于 Hallo-Live 是首个将流式双流扩散与偏好引导蒸馏结合用于实时文本驱动音视频生成的框架,我们深信其前景广阔。
引用
@article{arxiv.2604.23632,
title = {Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation},
author = {Chunyu Li and Jiaye Li and Ruiqiao Mei and Haoyuan Xia and Hao Zhu and Jingdong Wang and Siyu Zhu},
journal= {arXiv preprint arXiv:2604.23632},
year = {2026}
}