中文

HOI-Swap:面向手部-物体交互感知的视频中物体置换

计算机视觉与模式识别 2024-11-12 v2

摘要

我们研究了在视频中精确置换物体的问题,尤其关注被手部交互(Hand-Object Interaction, HOI)影响的物体,给定用户提供的参考物体图像。尽管扩散模型在视频编辑领域取得了显著进展,这些模型在处理手部-物体交互细节方面仍显不足,尤其当物体置换导致物体形状或功能变化时,往往无法生成真实的编辑结果。为弥合这一差距,我们提出了 HOI-Swap,一个基于自监督训练的新型扩散视频编辑框架。该框架分为两个阶段:第一个阶段聚焦于具备手部-物体交互感知的单帧物体置换;模型学习根据物体属性变化调整交互模式,如手部抓握方式。第二个阶段将单帧编辑扩展至整个视频序列;通过(1)基于采样运动点对编辑后帧进行形变生成新序列,(2)以形变序列为条件进行视频生成,实现与原视频的可控运动对齐。全面的定性和定量评估表明,HOI-Swap 显著优于现有方法,能生成高质量且具备真实手部-物体交互的视频编辑。

关键词

引用

@article{arxiv.2406.07754,
  title  = {HOI-Swap: Swapping Objects in Videos with Hand-Object Interaction Awareness},
  author = {Zihui Xue and Mi Luo and Changan Chen and Kristen Grauman},
  journal= {arXiv preprint arXiv:2406.07754},
  year   = {2024}
}

备注

Accepted by NeurIPS 2024, Project website: https://vision.cs.utexas.edu/projects/HOI-Swap/