中文

通过基于抽样的推断检测视觉大语言模型的知识边界

计算与语言 2025-08-26 v3

摘要

尽管在视觉大语言模型(VLLMs)方面取得了进展,但像文本大语言模型(LLMs)一样,它们在处理需要实时信息或知识密集型问题的查询时仍存在局限。无偏颇地采用检索增强生成(RAG)技术是一种有效但昂贵的做法,使模型能够回答其知识范围之外的查询。为缓解对检索的依赖,同时保持甚至提升由检索提供的性能优势,我们提出了一种检测 VLLM 知识边界的方法,以实现更高效地使用此类技术。具体而言,我们提出了两种变体的方法,通过自动构建的数据集对 VLLM 进行微调,以实现边界识别。在 various 类型的数据集上进行的实验结果表明,我们的方法成功描绘了 VLLM 的知识边界,据此我们能够在保持或提高性能的同时减少不必要的检索。此外,我们展示了一种 VLLM 通过我们方法识别的知识边界可作为其他 VLLM 的替代边界。代码将在 https://github.com/Chord-Chen-30/VLLM-KnowledgeBoundary 发布

关键词

引用

@article{arxiv.2502.18023,
  title  = {Detecting Knowledge Boundary of Vision Large Language Models by Sampling-Based Inference},
  author = {Zhuo Chen and Xinyu Wang and Yong Jiang and Zhen Zhang and Xinyu Geng and Pengjun Xie and Fei Huang and Kewei Tu},
  journal= {arXiv preprint arXiv:2502.18023},
  year   = {2025}
}

备注

EMNLP2025 Main Conference