中文

基于用户反馈驱动的视觉-语言导航自适应

人工智能 2026-02-05 v2

摘要

视觉-语言导航(VLN)代理的真实部署受到离线训练后可靠监督稀缺的制约。虽然最近的自适应方法试图通过环境驱动的自监督(如熵最小化)来缓解分布偏移,但这些信号往往嘈杂,并可能导致代理在长时序顺序决策中放大自身错误。在本文中,我们提出了一种范式转变,将用户反馈——具体为片段级成功确认和目标级纠正——定位为VLN的主要且通用的监督信号。与内部置信度分数不同,用户反馈与意图对齐且现场一致,直接纠正代理与用户指令的解耦。为有效利用这种监督,我们引入了一个用户反馈驱动的学习框架,其特征是拓扑感知轨迹构建机制。该机制通过在代理增量构建的拓扑图上生成可行路径,将稀疏的目标级纠正提升为密集的路径级监督,从而在不要求逐步人类演示的情况下实现样本高效的模仿学习。此外,我们开发了一种持久记忆库机制用于热启动初始化,支持在导航会话之间复用先前获取的拓扑和缓存表示。在GSA-R2R基准上的广泛实验表明,我们的方法将稀疏交互转化为鲁棒监督,持续优于环境驱动的基线,并在多样化的指令风格下展现出强大的适应性。

关键词

引用

@article{arxiv.2512.10322,
  title  = {User-Feedback-Driven Adaptation for Vision-and-Language Navigation},
  author = {Yongqiang Yu and Xuhui Li and Hazza Mahmood and Jinxing Zhou and Haodong Hong and Longtao Jiang and Zhiqiang Xu and Qi Wu and Xiaojun Chang},
  journal= {arXiv preprint arXiv:2512.10322},
  year   = {2026}
}