COSMO:面向低成本视觉语言导航的选择性记忆组合
计算机视觉与模式识别
2025-04-01 v1 机器人学
摘要
视觉语言导航(VLN)任务因其在家庭助手等领域的潜在应用而在人工智能研究中受到关注。许多当代VLN方法虽基于变换器架构,但日益增加了外部知识库或地图信息等额外组件以提升性能。这些 additions 虽能提升性能,却导致模型体积增大和计算成本增加。本文提出一种新型架构COSMO(COmbination of Selective MemOrization),以实现高性能与低计算成本的双重目标。具体而言,COSMO集成了时态空间模块和变换器模块,并包含两种VLN定制化选择性时态空间模块:轮选扫描(RSS)和交叉模态选择性时态空间模块(CS3)。RSS实现单个扫描内的全模态互动,而CS3模块将选择性时态空间模块适配为双流架构,从而增强跨模态互动的获取。在三个主流VLN基准测试(REVERIE、R2R和R2R-CE)上的实验验证表明,我们的模型不仅在导航性能上表现具有竞争力,还在计算成本方面显著降低。
引用
@article{arxiv.2503.24065,
title = {COSMO: Combination of Selective Memorization for Low-cost Vision-and-Language Navigation},
author = {Siqi Zhang and Yanyuan Qiao and Qunbo Wang and Zike Yan and Qi Wu and Zhihua Wei and Jing Liu},
journal= {arXiv preprint arXiv:2503.24065},
year = {2025}
}