中文

MirrorMe:面向实时高保真音频驱动半身动画的技术

计算机视觉与模式识别 2025-06-30 v1

摘要

音频驱动的肖像动画通过利用音频信号合成逼真视频面临着在实时生成高保真、时序一致动画方面的显著挑战。虽然最近的扩散方法通过将音频整合到去噪过程中提高了生成质量,但其依赖逐帧 UNet 架构导致延迟高且难以实现时序一致性。本文引入 MirrorMe,一个基于 LTX 视频模型构建的实时可控框架。LTX 视频模型是一种压缩空间和时间维度以实现高效潜在空间去噪的扩散变换器。为解决 LTX 在压缩率与语义保真度之间的权衡,本文提出三项创新:1. 基于 VAE 编码图像拼接和自注意力机制的参考身份注入机制,确保身份一致性;2.针对 LTX 时序结构的因果音频编码器和适配器,实现音频-表情精准同步;3.结合近景面部训练、半身合成(带面部遮罩)和手部姿态集成的渐进式训练策略,提升手势控制。大量实验表明,MirrorMe 在 EMTD 数据集上实现了在保真度、唇同步精度和时序稳定性方面的领先表现。

关键词

引用

@article{arxiv.2506.22065,
  title  = {MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation},
  author = {Dechao Meng and Steven Xiao and Xindi Zhang and Guangyuan Wang and Peng Zhang and Qi Wang and Bang Zhang and Liefeng Bo},
  journal= {arXiv preprint arXiv:2506.22065},
  year   = {2025}
}

备注

8 pages, 6 figures