HOI-Swap:面向手部-物体交互感知的视频中物体置换
计算机视觉与模式识别
2024-11-12 v2
摘要
我们研究了在视频中精确置换物体的问题,尤其关注被手部交互(Hand-Object Interaction, HOI)影响的物体,给定用户提供的参考物体图像。尽管扩散模型在视频编辑领域取得了显著进展,这些模型在处理手部-物体交互细节方面仍显不足,尤其当物体置换导致物体形状或功能变化时,往往无法生成真实的编辑结果。为弥合这一差距,我们提出了 HOI-Swap,一个基于自监督训练的新型扩散视频编辑框架。该框架分为两个阶段:第一个阶段聚焦于具备手部-物体交互感知的单帧物体置换;模型学习根据物体属性变化调整交互模式,如手部抓握方式。第二个阶段将单帧编辑扩展至整个视频序列;通过(1)基于采样运动点对编辑后帧进行形变生成新序列,(2)以形变序列为条件进行视频生成,实现与原视频的可控运动对齐。全面的定性和定量评估表明,HOI-Swap 显著优于现有方法,能生成高质量且具备真实手部-物体交互的视频编辑。
引用
@article{arxiv.2406.07754,
title = {HOI-Swap: Swapping Objects in Videos with Hand-Object Interaction Awareness},
author = {Zihui Xue and Mi Luo and Changan Chen and Kristen Grauman},
journal= {arXiv preprint arXiv:2406.07754},
year = {2024}
}
备注
Accepted by NeurIPS 2024, Project website: https://vision.cs.utexas.edu/projects/HOI-Swap/