通过基于抽样的推断检测视觉大语言模型的知识边界
计算与语言
2025-08-26 v3
摘要
尽管在视觉大语言模型(VLLMs)方面取得了进展,但像文本大语言模型(LLMs)一样,它们在处理需要实时信息或知识密集型问题的查询时仍存在局限。无偏颇地采用检索增强生成(RAG)技术是一种有效但昂贵的做法,使模型能够回答其知识范围之外的查询。为缓解对检索的依赖,同时保持甚至提升由检索提供的性能优势,我们提出了一种检测 VLLM 知识边界的方法,以实现更高效地使用此类技术。具体而言,我们提出了两种变体的方法,通过自动构建的数据集对 VLLM 进行微调,以实现边界识别。在 various 类型的数据集上进行的实验结果表明,我们的方法成功描绘了 VLLM 的知识边界,据此我们能够在保持或提高性能的同时减少不必要的检索。此外,我们展示了一种 VLLM 通过我们方法识别的知识边界可作为其他 VLLM 的替代边界。代码将在 https://github.com/Chord-Chen-30/VLLM-KnowledgeBoundary 发布
引用
@article{arxiv.2502.18023,
title = {Detecting Knowledge Boundary of Vision Large Language Models by Sampling-Based Inference},
author = {Zhuo Chen and Xinyu Wang and Yong Jiang and Zhen Zhang and Xinyu Geng and Pengjun Xie and Fei Huang and Kewei Tu},
journal= {arXiv preprint arXiv:2502.18023},
year = {2025}
}
备注
EMNLP2025 Main Conference