Reenact Anything: 使用运动-文本内嵌实现语义视频运动迁移
计算机视觉与模式识别
2025-05-27 v2 图形学
机器学习
摘要
近年来,视频生成和编辑技术的质量取得了显著提升。虽然有多个技术专注于编辑外观,但很少有技术解决运动问题。使用文本、轨迹或边界框的现有方法仅限于简单运动,因此我们指定单个运动参考视频来指定运动。我们进一步提议使用预训练的图像到视频模型而非文本到视频模型。这种方法允许我们保留目标对象或场景的确切外观和位置,有助于分离外观与运动。我们的方法称为运动-文本内嵌,利用我们观察到的事实:图像到视频模型主要从(潜在)图像输入中提取外观,而通过跨注意力注入的文本/图像嵌入主要控制运动。因此,我们使用文本/图像嵌入标记表示运动。通过在包含多个文本/图像嵌入标记的扩充运动-文本嵌入上操作,我们实现了高时序运动细粒度。一旦在运动参考视频上优化,该嵌入可应用于各种目标图像以生成类似语义的运动视频。我们的方法无需目标运动参考视频和目标图像之间的空间对齐,能够跨越各种领域,并可应用于各种任务,如全身和面部重现,以及控制无机物体和摄像机的运动。我们经验性地证明了该方法在语义视频运动迁移任务中的有效性,在该上下文中显著优于现有方法。项目网站: https://mkansy.github.io/reenact-anything/
引用
@article{arxiv.2408.00458,
title = {Reenact Anything: Semantic Video Motion Transfer Using Motion-Textual Inversion},
author = {Manuel Kansy and Jacek Naruniec and Christopher Schroers and Markus Gross and Romann M. Weber},
journal= {arXiv preprint arXiv:2408.00458},
year = {2025}
}
备注
Added more evaluation and analyses since first version. Accepted to SIGGRAPH 2025 (Conference Track). Project page: https://mkansy.github.io/reenact-anything/