中文

AnyCrowd:任意多角色动画的实例隔离身份-姿态绑定

计算机视觉与模式识别 2026-03-17 v1

摘要

可控角色动画近年来取得了快速进展,但多角色动画仍鲜有探索。随着角色数量的增加,多角色参考编码更容易受到潜在身份 entanglement 的影响,导致身份泄漏和可控性下降。此外,在参考身份与驱动姿态序列之间学习精确且时空一致的对应关系变得日益具有挑战性,常导致身份-姿态绑定不当以及生成视频中的不一致性。为此,我们提出AnyCrowd——一个能够扩展到任意角色数量的扩散转换器(DiT)基于视频生成框架。具体而言,我们首先引入实例隔离潜在表示(IILR),该表示在DiT处理之前独立编码角色实例,以防止潜在身份entanglement。基于这一解缥散的表示,我们进一步提出三阶段解耦注意力(TSDA),通过将自注意力分解为:(i)实例感知的前景注意力、(ii)以背景为中心的相互作用、(iii)全局前景-背景协调,来将身份绑定到驱动姿态。此外,为缓解重叠区域中token的歧义,我们在TSDA内部集成自适应门控融合(AGF)模块,以预测身份感知权重,有效地将竞争性token组融合为身份一致的表示。

关键词

引用

@article{arxiv.2603.15415,
  title  = {AnyCrowd: Instance-Isolated Identity-Pose Binding for Arbitrary Multi-Character Animation},
  author = {Zhenyu Xie and Ji Xia and Michael Kampffmeyer and Panwen Hu and Zehua Ma and Yujian Zheng and Jing Wang and Zheng Chong and Xujie Zhang and Xianhang Cheng and Xiaodan Liang and Hao Li},
  journal= {arXiv preprint arXiv:2603.15415},
  year   = {2026}
}