中文

基于在线增强解构视觉-语言导航中的前景与背景

计算机视觉与模式识别 2025-10-02 v1

摘要

跟随语言指令,视觉-语言导航 (VLN) 智能体需导航至未知环境。虽然增强多样化视觉表征已推动VLN领域的进步,但前景和背景在视觉观察中的重要性仍未得到充分探索。直观地看,前景区域提供语义线索,而背景则包含空间连通性信息。基于此洞察,我们提出一种共识驱动的在线特征增强策略 (COFA),交替使用前景和背景特征以促进可导航的泛化。具体而言,我们首先利用语义增强的地标识别将前景和背景分离为候选增强特征。随后,一种共识驱动的在线增强策略鼓励智能体根据不同指令和导航位置整合两阶段投票结果关于特征偏好的决策。在REVERIE和R2R数据集上的实验表明,我们的在线前景-背景增强提升了基线方法的泛化能力,并实现了最新的性能。

关键词

引用

@article{arxiv.2510.00604,
  title  = {Disentangling Foreground and Background for vision-Language Navigation via Online Augmentation},
  author = {Yunbo Xu and Xuesong Zhang and Jia Li and Zhenzhen Hu and Richang Hong},
  journal= {arXiv preprint arXiv:2510.00604},
  year   = {2025}
}