用于揭示视觉-语言导航的动作原子概念学习
计算机视觉与模式识别
2024-03-15 v2 人工智能
摘要
视觉-语言导航(VLN)是一项具有挑战性的任务,要求智能体将复杂的视觉观测与语言指令对齐以到达目标位置。大多数现有VLN智能体直接学习将使用one-hot标签训练的原始方向特征与视觉特征对齐到语言指令特征。然而,这些多模态输入之间的巨大语义鸿沟使得对齐困难,从而限制了导航性能。本文提出动作原子概念学习(AACL),将视觉观测映射到动作原子概念以促进对齐。具体而言,动作原子概念是包含原子动作与物体的自然语言短语,例如“上楼梯”。这些作为观测与指令之间桥梁的动作原子概念,能有效缓解语义鸿沟并简化对齐。AACL包含三个核心组件:1) 概念映射模块,通过VLN环境与近期提出的对比语言-图像预训练(CLIP)模型将观测映射到动作原子概念表示;2) 概念精炼适配器,通过对CLIP预测的物体概念重排序以鼓励提取更面向指令的物体概念;3) 观测协同嵌入模块,利用概念表示对观测表示进行正则化。我们的AACL在细粒度(R2R)与高层(REVERIE和R2R-Last) VLN基准上均建立了新的state-of-the-art结果。此外,可视化显示AACL显著提升了动作决策的可解释性。
引用
@article{arxiv.2302.06072,
title = {Actional Atomic-Concept Learning for Demystifying Vision-Language Navigation},
author = {Bingqian Lin and Yi Zhu and Xiaodan Liang and Liang Lin and Jianzhuang Liu},
journal= {arXiv preprint arXiv:2302.06072},
year = {2024}
}
备注
Accepted by AAAI 2023