中文

QueryAdapter:视觉语言模型对自然语言查询的快速自适应

机器人学 2025-02-27 v1 计算机视觉与模式识别

摘要

用于训练视觉语言模型(VLM)的大规模互联网数据与机器人采集的原始图像流之间存在领域偏移。现有的自适应策略需要定义一个封闭的类别集合,这对于必须响应多样化自然语言查询的机器人来说是不切实际的。作为回应,我们提出了QueryAdapter;一种用于根据自然语言查询快速自适应预训练VLM的新型框架。QueryAdapter利用先前部署期间收集的无标注数据,将VLM特征与查询相关的语义类别对齐。通过优化可学习的提示词令牌并主动选择训练对象,可以在几分钟内生成一个自适应模型。我们还探讨了在使用真实世界数据进行自适应时如何处理与查询无关的对象。作为补充,我们提出使用物体描述作为负类别标签,有助于在自适应过程中产生更好校准的置信度分数。在ScanNet++上的大量实验表明,QueryAdapter显著提升了物体检索性能,优于最先进的无监督VLM适配器和3D场景图方法。此外,该方法在抽象功能查询和其他数据集(如Ego4D)上表现出稳健的泛化能力。

关键词

引用

@article{arxiv.2502.18735,
  title  = {QueryAdapter: Rapid Adaptation of Vision-Language Models in Response to Natural Language Queries},
  author = {Nicolas Harvey Chapman and Feras Dayoub and Will Browne and Christopher Lehnert},
  journal= {arXiv preprint arXiv:2502.18735},
  year   = {2025}
}