IM-Animation:用于身份解耦角色动画的隐式运动表示
机器学习
2026-02-10 v1
摘要
最近视频扩散模型的进展显著推动了角色动画,该方法通过根据驾驶视频对静止身份图像进行动画化来合成运动视频。显式方法使用骨骼、DWPose 或其他显式结构信号表示运动,但难以处理空间不匹配和 varying body scales。隐式方法直接从驾驶视频捕获高层隐式运动语义,但 suffer from identity leakage(身份泄漏)和运动与外观的 entanglement( entanglement)。为解决上述挑战,我们提出一种新型隐式运动表示,将每帧运动压缩为紧凑的 1D 运动 token。这种设计放宽了 2D 表示固有的严格空间约束,有效防止了运动视频中身份信息的泄漏。此外,我们设计一种基于时间一致性掩码 token 的 retargeting 模块,强制执行时间训练瓶颈,减轻源图像运动的干扰,提高 retargeting 的一致性。我们的 methodology 采用三阶段训练策略以提高训练效率并确保高保真度。大量实验表明,我们的隐式运动表示和提出的 IM-Animation 的生成能力在与最先进方法之间取得优势或相当的性能。
引用
@article{arxiv.2602.07496,
title = {CoMI-IRL: Contrastive Multi-Intention Inverse Reinforcement Learning},
author = {Antonio Mone and Frans A. Oliehoek and Luciano Cavalcante Siebert},
journal= {arXiv preprint arXiv:2602.07496},
year = {2026}
}
备注
14 pages, 6 figures