MOGRAS:3D 场景中的人类动作与抓取
计算机视觉与模式识别
2025-10-28 v1 图形学
机器人学
摘要
在 3D 场景中生成逼真的全身动作与物体交互,对机器人、虚拟现实和人机交互等应用至关重要。虽然现有方法能够在 3D 场景中生成全身动作,但往往缺乏对细粒度任务(如物体抓取)的高保真度。相反,专注于生成精确抓取动作的方法则忽略了周围 3D 场景。这种在 3D 场景中生成具有物理真实性的全身抓取动作的差距仍是一个重要挑战。为此,我们提出 MOGRAS(Human Motion with GRAsping in 3D Scenes),一个大规模数据集,旨在弥合这一差距。MOGRAS 提供了在丰富标注的 3D 室内场景中进行预抓取全身步行动作和最终抓取姿态的能力。我们利用 MOGRAS 对现有全身抓取方法进行基准测试,展示了其在场景感知生成中的局限性。此外,我们提出一种简单而有效的方法,将现有方法适配到 3D 场景中。通过大量定量和定性实验,我们验证了该数据集和我们提出方法的有效性,为更真实的人体-场景交互指明了道路。
引用
@article{arxiv.2510.22199,
title = {MOGRAS: Human Motion with Grasping in 3D Scenes},
author = {Kunal Bhosikar and Siddharth Katageri and Vivek Madhavaram and Kai Han and Charu Sharma},
journal= {arXiv preprint arXiv:2510.22199},
year = {2025}
}
备注
British Machine Vision Conference Workshop - From Scene Understanding to Human Modeling