中文

DanceTogether! 身份保持的多人交互视频生成

计算机视觉与模式识别 2025-05-26 v1

摘要

可控视频生成(CVG)技术近期快速发展,但当前系统在多于一位演员需移动、交互并交换位置,且控制信号噪声较大时,仍表现不佳。我们通过 DanceTogether,首个端到端扩散框架,将单张参考图像加上独立的姿态-掩码流,生成长时段、照片般逼真的视频,同时严格保持每个人的身份信息。 novel MaskPoseAdapter 模块在每个去噪步骤通过融合稳健跟踪掩码与语义丰富但噪声较大的姿态热图,将“谁”与“如何”绑定,从而消除帧级方法中常见的身份漂移和外观泄漏问题。为大规模训练与评估,我们引入(i)PairFS-4K,26 小时的双侧滑冰片 footage,包含 7000 多套不同的身份信息;(ii)HumanRob-300,一小时的人oid-机器人交互数据集,以便快速跨域迁移;(iii)TogetherVideoBench,一个三轨制基准,包含以 DanceTogEval-100 测试套件为核心,覆盖舞蹈、拳击、摔跼、瑜伽和花式滑冰等场景。实验表明,在 TogetherVideoBench 上,DanceTogether 以显著优势超越现有方法。此外,我们展示仅需一小时微调即可生成逼真的人机视频,凸显其对具身智能和人机交互任务的广泛泛化能力。大量消融实验确认,持久的身份-动作绑定对这些提升至关重要。总体而言,我们的模型、数据集和基准将 CVG 从单主体编舞推向可控的、多演员交互时代,为数字制作、仿真和具身智能开辟了新方向。我们的视频演示和代码已公开于 https://DanceTog.github.io/。

关键词

引用

@article{arxiv.2505.18078,
  title  = {DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation},
  author = {Junhao Chen and Mingjin Chen and Jianjin Xu and Xiang Li and Junting Dong and Mingze Sun and Puhua Jiang and Hongxiang Li and Yuhang Yang and Hao Zhao and Xiaoxiao Long and Ruqi Huang},
  journal= {arXiv preprint arXiv:2505.18078},
  year   = {2025}
}

备注

Our video demos and code are available at https://DanceTog.github.io/