中文

情景记忆问答

计算机视觉与模式识别 2022-05-04 v1 人工智能

摘要

诸如可穿戴眼镜的自我中心增强现实设备,会在人类佩戴者游览家庭环境时被动捕获视觉数据。我们设想这样一种场景:人类通过提问(例如,你最后一次看到我的钥匙是在哪里?)与驱动此类设备的AI智能体交流。为成功完成该任务,自我中心AI助手必须(1)构建语义丰富且高效的场景记忆,编码游览过程中所见物体的时空信息,且(2)具备理解问题并将答案锚定到语义记忆表示的能力。为此,我们引入(1)一项新任务——情景记忆问答(EMQA),其中自我中心AI助手以视频序列(游览过程)和问题作为输入,被要求将问题答案定位到游览过程中;(2)一个旨在探查智能体对游览过程时空理解能力的接地问题数据集;以及(3)一个将该场景编码为异中心、自上而下的语义特征图并将问题锚定到图中以定位答案的任务模型。我们展示了我们所选的情景场景记忆优于该任务的朴素现成解决方案以及一系列极具竞争力的基线,并且对深度、位姿以及相机抖动中的噪声具有鲁棒性。项目页面见:https://samyak-268.github.io/emqa。

关键词

引用

@article{arxiv.2205.01652,
  title  = {Episodic Memory Question Answering},
  author = {Samyak Datta and Sameer Dharur and Vincent Cartillier and Ruta Desai and Mukul Khanna and Dhruv Batra and Devi Parikh},
  journal= {arXiv preprint arXiv:2205.01652},
  year   = {2022}
}

备注

Published at CVPR 2022 (Oral presentation)