ADAPT:基于模态对齐动作提示的视觉-语言导航
计算机视觉与模式识别
2022-06-01 v1 人工智能
计算与语言
摘要
视觉-语言导航(VLN)是一项极具挑战性的任务,要求具身智能体在复杂视觉环境中执行动作级模态对齐,即按顺序完成指令所要求的动作。现有多数 VLN 智能体直接学习指令-路径数据,难以充分挖掘多模态输入内部的动作级对齐知识。本文提出模态对齐动作提示(ADAPT),为 VLN 智能体提供动作提示,以实现动作级模态对齐的显式学习,从而达成成功导航。具体而言,动作提示被定义为图像子提示与文本子提示的模态对齐对,前者为单视角观测,后者为如“走过椅子”之类的短语。导航开始时,从预构建的动作提示库中检索指令相关的动作提示集,并经提示编码器得到提示特征;随后将提示特征与原始指令特征拼接,输入多层 transformer 进行动作预测。为向提示库收集高质量动作提示,我们使用具备强大跨模态对齐能力的对比语言-图像预训练(CLIP)模型。进一步引入模态对齐损失与序列一致性损失,以增强动作提示的对齐并迫使智能体按顺序关注相关提示。在 R2R 与 RxR 上的实验结果表明,ADAPT 优于当前最优方法。
引用
@article{arxiv.2205.15509,
title = {ADAPT: Vision-Language Navigation with Modality-Aligned Action Prompts},
author = {Bingqian Lin and Yi Zhu and Zicong Chen and Xiwen Liang and Jianzhuang Liu and Xiaodan Liang},
journal= {arXiv preprint arXiv:2205.15509},
year = {2022}
}
备注
Accepted to CVPR 2022