Drag-A-Video:基于点交互的非刚性视频编辑
计算机视觉与模式识别
2023-12-06 v1
摘要
视频编辑是一项具有挑战性的任务,需要在空间和时间维度上操作视频。现有的视频编辑方法主要侧重于改变视频中对象的外观或风格,同时保持其结构不变。然而,目前还没有一种方法允许用户交互式地“拖动”第一帧上实例的任意点,以精确到达目标点,并使其他帧一致地变形。在本文中,我们提出了一种新的基于扩散的交互式点视频操作方法,称为Drag-A-Video。我们的方法允许用户在输入视频的第一帧上点击成对的控制点、目标点以及掩码。然后,我们的方法将输入转换为点集,并在帧间传播这些点集。为了精确修改视频内容,我们采用了一种新的视频级运动监督来更新视频的特征,并引入潜在偏移量以在多个去噪时间步实现此更新。我们提出了一个时间一致的点跟踪模块来协调手柄点集中点的移动。我们在各种视频上展示了我们方法的有效性和灵活性。我们的工作网站可在此处访问:https://drag-a-video.github.io/。
引用
@article{arxiv.2312.02936,
title = {Drag-A-Video: Non-rigid Video Editing with Point-based Interaction},
author = {Yao Teng and Enze Xie and Yue Wu and Haoyu Han and Zhenguo Li and Xihui Liu},
journal= {arXiv preprint arXiv:2312.02936},
year = {2023}
}