中文

AsymTalker:基于非对称蒸馏的身份一致长期说话头部生成

机器学习 2026-05-12 v3 人工智能 声音

摘要

扩散模型驱动的说话头部生成在视觉质量方面取得了显著进展,但将其扩展到长期视频仍具有挑战性。广泛采用的块状范式引入了两个根本性的失败:(1) 静态身份参考与动态音频流之间的时空错位,以及 (2) 通过自生成的连续参考在块之间传播的身份漂移。为解决这两个问题,我们提出了AsymTalker,一种 novel 的扩散模型驱动的说话头部生成方法,包括时序参考编码 (TRE) 和非对称知识蒸馏 (AKD)。首先,TRE 通过对时序复制的伪视频进行编码,将静态身份图像转化为时序一致的潜在表示,从而缓解时空错位,而无需引入额外参数。其次,AKD 解决了块状训练中固有的条件性困境:使用真实参考会导致训练-推理不匹配,而自生成参考则将监督与身份漂移交织在一起。我们的非对称设计通过以真实连续性参考锚定教师模型,以提供无漂移的块级监督,从而避免教师瓶颈。同时,学生模型在推理对齐的条件下学习,仅依赖自生成参考,并通过分布匹配在长时间尺度上保持身份一致性。大量实验表明,AsymTalker 在 HDTF 和 VFHQ 上的效果达到最新水平。它保证了超过 600 秒视频的高保真、身份一致合成,并实现了 66 FPS 的实时推理速度。

关键词

引用

@article{arxiv.2605.02948,
  title  = {AsymTalker: Identity-Consistent Long-Term Talking Head Generation via Asymmetric Distillation},
  author = {Yuxin Lu and Jiayang Sun and Guibo Zhu and Min Cao},
  journal= {arXiv preprint arXiv:2605.02948},
  year   = {2026}
}