EgoEnv:从自我中心视频中学习以人为中心的环境表征
计算机视觉与模式识别
2023-11-13 v3
摘要
第一人称视频在相机佩戴者持续所处的环境背景下凸显其活动。然而,当前的视频理解方法对来自短片段的视觉特征进行推理,这些片段与底层物理空间脱节,且仅捕捉立即可见的内容。为促进以人为中心的环境理解,我们提出了一种通过学习与相机佩戴者(可能未看到的)局部周边环境具有预测关系的表征,将自我中心视频与环境联系起来的方法。我们使用来自模拟 3D 环境中智能体的视频训练此类模型(环境完全可观测),并在来自未见过环境的、人类捕获的真实世界视频上测试它们。在两个以人为中心的视频任务上,我们表明配备了我们环境感知特征的模型持续优于使用传统片段特征的对应模型。此外,尽管仅在模拟视频上训练,我们的方法成功处理了来自 HouseTours 和 Ego4D 的真实世界视频,并在 Ego4D NLQ 挑战上取得了最先进的结果。项目页面:https://vision.cs.utexas.edu/projects/ego-env/
引用
@article{arxiv.2207.11365,
title = {EgoEnv: Human-centric environment representations from egocentric video},
author = {Tushar Nagarajan and Santhosh Kumar Ramakrishnan and Ruta Desai and James Hillis and Kristen Grauman},
journal= {arXiv preprint arXiv:2207.11365},
year = {2023}
}
备注
Published in NeurIPS 2023 (Oral)