MotionShot: 面向文本生成视频中任意对象的自适应动作迁移
计算机视觉与模式识别
2025-07-23 v1
摘要
现有的文本生成视频方法难以将动作从参考对象平滑地迁移到外观或结构存在显著差异的目标对象上。为了应对这一挑战,我们引入了 MotionShot,这是一个无训练框架,能够以细粒度方式解析参考-目标对应关系,从而在保持外观连贯性的同时实现高保真动作迁移。具体而言,MotionShot 首先执行语义特征匹配,以确保参考对象和目标对象之间的高层对齐。然后,它通过参考到目标的形状重定向进一步建立低层形态对齐。通过使用时间注意力编码动作,我们的 MotionShot 能够连贯地在对象之间迁移动作,即使在存在显著的外观和结构差异的情况下也是如此,这一点已通过大量实验证明。项目页面位于:https://motionshot.github.io/。
引用
@article{arxiv.2507.16310,
title = {MotionShot: Adaptive Motion Transfer across Arbitrary Objects for Text-to-Video Generation},
author = {Yanchen Liu and Yanan Sun and Zhening Xing and Junyao Gao and Kai Chen and Wenjie Pei},
journal= {arXiv preprint arXiv:2507.16310},
year = {2025}
}