从自我中心视频中进行空间认知:视线之外,并非心智之外
计算机视觉与模式识别
2025-01-23 v2
摘要
当人类四处走动并执行日常任务时,即使物体目前不在视线范围内,他们也能够回忆起这些物体在环境中的放置位置。在本文中,我们旨在模拟这种空间认知能力。因此,我们提出了“视线之外,并非心智之外”的任务——使用通过自我中心相机捕获的观测结果对活动物体进行 3D 跟踪。我们引入了一种简单但有效的方法来解决这一具有挑战性的问题,称为 Lift, Match, and Keep (LMK)。LMK 将部分 2D 观测提升至 3D 世界坐标,利用视觉外观、3D 位置和交互随时间对其进行匹配以形成物体轨迹,并在物体移出相机视野时保持这些物体轨迹。我们在来自 EPIC-KITCHENS 的 100 个长视频上对 LMK 进行了基准测试。我们的结果表明,空间认知对于在短时间和长时间尺度上正确定位物体至关重要。例如,对于一个长的自我中心视频,我们估计了 50 个活动物体的 3D 位置。在 120 秒后,LMK 正确定位了 57% 的物体,相比之下,最近一种用于自我中心视频的 3D 方法仅为 33%,而一种通用的 2D 跟踪方法仅为 17%。
引用
@article{arxiv.2404.05072,
title = {Spatial Cognition from Egocentric Video: Out of Sight, Not Out of Mind},
author = {Chiara Plizzari and Shubham Goel and Toby Perrett and Jacob Chalk and Angjoo Kanazawa and Dima Damen},
journal= {arXiv preprint arXiv:2404.05072},
year = {2025}
}
备注
Accepted at 3DV 2025. 14 pages including references and appendix. Project Webpage: http://dimadamen.github.io/OSNOM/