SIGHT:基于图像-文本条件和几何引导的3D手-物体轨迹合成
计算机视觉与模式识别
2025-05-30 v3
摘要
当人类抓握物体时,他们会自然地在脑中形成轨迹来操作该物体以完成特定任务。建模手-物体交互先验对于推动机器人和具身 AI 系统在物理世界中有效学习操作具有重大潜力。我们引入 SIGHT,一个新任务,旨在从单张图像和简短的语言任务描述生成真实且物理上可行的3D手-物体交互轨迹。先前关于手-物体轨迹生成的工作通常依赖缺乏对目标物体明确 grounding 的文本输入,或假设访问3D物体网格,而这些网格往往比2D图像难以获取。我们提出 SIGHT-Fusion,一个基于扩散模型的图像-文本条件生成模型,通过从数据库中检索最相似的3D物体网格,并通过一种新颖的推理时扩散引导来强制执行几何手-物体交互约束来解决该任务。我们在 HOI4D 和 H2O 数据集上对模型进行基准测试,适应相关基线以适应这一新任务。实验表明,我们在生成轨迹的多样性和质量方面表现优异,以及在手-物体交互几何指标方面也表现出色。
引用
@article{arxiv.2503.22869,
title = {SIGHT: Synthesizing Image-Text Conditioned and Geometry-Guided 3D Hand-Object Trajectories},
author = {Alexey Gavryushin and Alexandros Delitzas and Luc Van Gool and Marc Pollefeys and Kaichun Mo and Xi Wang},
journal= {arXiv preprint arXiv:2503.22869},
year = {2025}
}