基于结构与接触感知表示的开放世界手-物交互视频生成
计算机视觉与模式识别
2025-12-02 v1
摘要
生成真实的手-物交互(HOI)视频是一个由于难以建模物理约束(如手与操作物体之间的接触和遮挡)而面临的重大挑战。当前方法将HOI表示作为辅助生成目标来指导视频合成。然而,2D与3D表示之间存在无法同时保证可扩展性和交互保真度的困境。为解决这一限制,我们提出了一种结构与接触感知表示,能够在无需3D标注的情况下捕获手-物接触、手-物遮挡以及整体结构上下文。这种以交互为导向且可扩展的监督信号使模型能够学习细粒度的交互物理,并在开放世界场景中实现泛化。为充分利用所提出的表示,我们引入一种共享-专化策略的联合生成范式,用于生成交互导向的表示和视频。大量实验表明,我们的方法在两个真实世界数据集上优于基于物理保真和时序连贯性的基于状态的学习方法。此外,我们的方法在挑战性的开放世界场景中表现出强大的泛化能力,凸显了该可扩展设计的益处。我们的项目页面为 https://hgzn258.github.io/SCAR/。
引用
@article{arxiv.2512.01677,
title = {Open-world Hand-Object Interaction Video Generation Based on Structure and Contact-aware Representation},
author = {Haodong Yan and Hang Yu and Zhide Zhong and Weilin Yuan and Xin Gong and Zehang Luo and Chengxi Heyu and Junfeng Li and Wenxuan Song and Shunbo Zhou and Haoang Li},
journal= {arXiv preprint arXiv:2512.01677},
year = {2025}
}