CrossMap Transformer:一种基于双重反向翻译的跨模态掩码路径Transformer用于视觉与语言导航
机器人学
2023-08-22 v2 计算机视觉与模式识别
摘要
由自然语言指令引导的导航特别适用于与用户自然交互的家用服务机器人。该任务涉及在给定自然语言导航指令时预测导致指定目的地的动作序列。因此该任务要求理解诸如“走出浴室并在右侧楼梯上等候”的指令。视觉与语言导航仍然具有挑战性,尤其是因为它需要探索环境并准确遵循指令指定的路径以建模语言与视觉之间的关系。为此,我们提出CrossMap Transformer网络,其编码语言与视觉特征以顺序生成路径。CrossMap transformer与一个基于Transformer的说话者相连,该说话者生成导航指令。两个网络共享潜在特征,通过双重反向翻译模型实现相互增强:生成的路径被翻译为指令,而生成的指令被翻译为路径。实验结果显示了我们的方法在指令理解与指令生成方面的优势。
引用
@article{arxiv.2103.00852,
title = {CrossMap Transformer: A Crossmodal Masked Path Transformer Using Double Back-Translation for Vision-and-Language Navigation},
author = {Aly Magassouba and Komei Sugiura and Hisashi Kawai},
journal= {arXiv preprint arXiv:2103.00852},
year = {2023}
}
备注
8 pages, 5 figures, 5 tables. Submitted to IEEE Robotics and Automation Letters