中文

更早知晓“右”对你的含义:通过多任务学习 grounding 相对方向的综合 VQA 数据集

计算机视觉与模式识别 2022-07-07 v1 计算与语言

摘要

空间推理对智能体而言是一项特殊挑战,同时又是其在物理世界中成功交互与沟通的先决条件。其中一项推理任务是通过相对方向,依据某参考物体的内在朝向来描述目标物体的位置。本文中,我们引入 GRiD-A-3D,一个基于抽象物体的新颖诊断性视觉问答(VQA)数据集。我们的数据集可对端到端 VQA 模型 grounding 相对方向的能力进行细粒度分析。同时,模型训练相比现有数据集所需计算资源显著更少,却能产生相当甚至更高的性能。除新数据集外,我们基于在两个广泛已知的端到端 VQA 架构上于 GRiD-A-3D 上的训练提供了透彻评估。我们证明,在少量轮次内,推理相对方向所需的子任务——如识别并定位场景中的物体并估计其内在朝向——以相对方向被直观处理的顺序被学习。

关键词

引用

@article{arxiv.2207.02624,
  title  = {Knowing Earlier what Right Means to You: A Comprehensive VQA Dataset for Grounding Relative Directions via Multi-Task Learning},
  author = {Kyra Ahrens and Matthias Kerzel and Jae Hee Lee and Cornelius Weber and Stefan Wermter},
  journal= {arXiv preprint arXiv:2207.02624},
  year   = {2022}
}