中文

Chat2Map:基于多主体对话的高效场景建图

计算机视觉与模式识别 2023-04-24 v2 机器学习 声音 音频与语音处理

摘要

从多个第一人称视角捕获的对话视频能否以低成本方式揭示场景的地图?我们试图通过提出一个新问题来回答:利用自然对话中参与者的第一人称视听观测所共享的信息,高效构建此前未见的 3D 环境的地图。我们的假设是,当多个人(“自我主体”)在场景中移动并相互交谈时,他们会接收到丰富的视听线索,有助于揭示场景的未观测区域。鉴于持续处理第一人称视觉流的代价高昂,我们进一步探索如何主动协调视觉信息的采样,以最小化冗余并降低功耗。为此,我们提出一种视听深度强化学习方法,其与我们的共享场景映射器协同工作,选择性开启相机以高效勾勒空间。我们使用最先进的 3D 场景视听模拟器以及真实世界视频对该方法进行了评估。我们的模型优于以往最先进的建图方法,并实现了优异的代价-精度权衡。项目:http://vision.cs.utexas.edu/projects/chat2map。

关键词

引用

@article{arxiv.2301.02184,
  title  = {Chat2Map: Efficient Scene Mapping from Multi-Ego Conversations},
  author = {Sagnik Majumder and Hao Jiang and Pierre Moulon and Ethan Henderson and Paul Calamia and Kristen Grauman and Vamsi Krishna Ithapu},
  journal= {arXiv preprint arXiv:2301.02184},
  year   = {2023}
}

备注

Accepted to CVPR 2023