VIDMP3:基于姿态和位置先验表示运动的视频编辑
计算机视觉与模式识别
2025-10-15 v1
摘要
保持运动的视频编辑对于创作者尤为重要,尤其是在需要灵活控制替换对象结构和语义的场景下。尽管具有巨大的潜力,但该领域仍未得到充分探索。现有基于扩散的编辑方法在结构保持任务中表现出色,利用稠密引导信号确保内容完整性。尽管有些近期方法试图解决结构可变编辑问题,但常常出现时序不一致、主体身份漂移以及需要人工干预等问题。为此,我们引入VidMP3,一种新方法,利用姿态和位置先验从源视频中学习通用的运动表示。我们的方法 enables 生成保持原始运动的新视频,同时允许结构和语义的灵活性。定性和定量评估均表明,我们的方法在现有方法之上具有优势。该代码将在https://github.com/sandeep-sm/VidMP3 公开。
引用
@article{arxiv.2510.12069,
title = {VIDMP3: Video Editing by Representing Motion with Pose and Position Priors},
author = {Sandeep Mishra and Oindrila Saha and Alan C. Bovik},
journal= {arXiv preprint arXiv:2510.12069},
year = {2025}
}