中文

面向在线视觉-语言导航的快速-慢速测试时自适应

计算机视觉与模式识别 2024-05-21 v4

摘要

准确理解自然语言指令并导航至目标位置是具身智能体的关键能力。此类智能体通常需以在线方式执行用户指令,这促使我们探索利用无标签测试样本进行有效在线模型自适应。然而,对于在线视觉-语言导航(VLN),由于样本间在线指令执行的固有特性和样本内多步动作决策的固有特性,频繁更新会导致模型参数剧烈变化,而偶尔更新则会使模型难以应对动态变化的环境。因此,我们提出一种用于在线VLN的快速-慢速测试时自适应(FSTTA)方法,通过在统一框架中对梯度和参数进行联合分解-累积分析。大量实验表明,我们的方法在四个流行基准上获得了令人印象深刻的性能提升。代码见 https://github.com/Feliciaxyao/ICML2024-FSTTA。

关键词

引用

@article{arxiv.2311.13209,
  title  = {Fast-Slow Test-Time Adaptation for Online Vision-and-Language Navigation},
  author = {Junyu Gao and Xuan Yao and Changsheng Xu},
  journal= {arXiv preprint arXiv:2311.13209},
  year   = {2024}
}

备注

Accepted by International Conference on Machine Learning (ICML 2024)