中文

迈向通用具身导航

计算机视觉与模式识别 2022-11-01 v1

摘要

随着各类视觉导航任务(例如图像目标、物体目标、音频目标以及视觉语言导航)的出现,这些任务以不同方式指定目标,学界已在训练能良好处理单个导航任务的专用智能体方面取得引人注目的进展。鉴于大量具身导航任务与任务特定解决方案,我们探讨一个更根本的问题:我们能否学习一个强大的单一智能体,其同时掌握多种而非仅一种导航任务?首先,我们提出 VXN,一个大规模 3D 数据集,其在标准化、连续且视听丰富的环境中实例化四种经典导航任务。其次,我们提出 Vienna,一个通用具身导航智能体,其以单一模型同时学习执行这四种导航任务。基于全注意力架构,Vienna 将各类导航任务公式化为统一的解析与查询流程:目标描述辅以四个任务嵌入,被全面解释为一组多样化目标向量,其随导航推进而精炼,并用作查询以从情景历史中检索支撑上下文用于决策。这使得知识能在具有不同输入域/模态的导航任务间复用。我们通过实证表明,与单独学习每个视觉导航任务相比,我们的多任务智能体以更低的复杂度实现了可比甚至更优的性能。

关键词

引用

@article{arxiv.2210.16822,
  title  = {Towards Versatile Embodied Navigation},
  author = {Hanqing Wang and Wei Liang and Luc Van Gool and Wenguan Wang},
  journal= {arXiv preprint arXiv:2210.16822},
  year   = {2022}
}

备注

Accepted to NeurIPS 2022; Code: https://github.com/hanqingwangai/VXN