中文

微调视觉-语言模型以辅助视觉导航

计算机视觉与模式识别 2025-09-10 v1 人工智能

摘要

我们致力于解决视觉-语言驱动的室内导航问题,旨在通过图像和自然语言指引,帮助视障人士到达目标位置。由于缺乏精确的位置数据,传统导航系统在室内效果不佳。我们的方法整合了视觉和语言模型,以生成逐步导航指令,从而增强可访问性和独立性。我们在一个手动标注的室内导航数据集上,使用低秩适应(LoRA)技术对BLIP-2模型进行微调。我们提出了一种评估指标,通过强调方向和顺序变量来改进BERT F1分数,为导航性能提供了更全面的度量。应用LoRA后,模型在生成方向性指令方面显著改进,克服了原始BLIP-2模型的局限性。

关键词

引用

@article{arxiv.2509.07488,
  title  = {Fine-Tuning Vision-Language Models for Visual Navigation Assistance},
  author = {Xiao Li and Bharat Gandhi and Ming Zhan and Mohit Nehra and Zhicheng Zhang and Yuchen Sun and Meijia Song and Naisheng Zhang and Xi Wang},
  journal= {arXiv preprint arXiv:2509.07488},
  year   = {2025}
}