VISITRON:视觉语义对齐的交互式训练物体导航器
计算机视觉与模式识别
2022-03-17 v2 人工智能
计算与语言
机器学习
机器人学
摘要
在照片级真实感环境中导航的交互式机器人,除了视觉与语言导航(VLN)固有的挑战外,还需被训练以有效利用和处理对话的动态特性。本文中,我们提出VISITRON,一种基于多模态Transformer的导航器,更适用于协作视觉与对话导航(CVDN)固有的交互式机制。VISITRON被训练以:i)识别并关联环境与对话历史之间的物体级概念与语义,ii)通过对二分类头的模仿学习识别何时交互而非导航。我们对VISITRON进行了广泛的预训练与微调消融实验,以获得经验见解并提升CVDN上的性能。VISITRON识别何时交互的能力自然推广了Roman等人(arXiv:2005.00728)引入的游戏玩法模式,使此类模型可用于不同环境。VISITRON在静态CVDN排行榜上与各模型具竞争力,并在按路径长度加权的成功率(SPL)指标上取得当前最优性能。
引用
@article{arxiv.2105.11589,
title = {VISITRON: Visual Semantics-Aligned Interactively Trained Object-Navigator},
author = {Ayush Shrivastava and Karthik Gopalakrishnan and Yang Liu and Robinson Piramuthu and Gokhan Tür and Devi Parikh and Dilek Hakkani-Tür},
journal= {arXiv preprint arXiv:2105.11589},
year = {2022}
}
备注
Accepted at Findings of the Annual Meeting of the Association for Computational Linguistics (ACL) 2022, previous version accepted at Visually Grounded Interaction and Language (ViGIL) Workshop at NAACL 2021