中文

轻量级自然语言知识集成框架 NLKI:提升小型视觉语言模型在常识 VQA 任务中的表现

计算与语言 2025-08-29 v2 人工智能

摘要

常识视觉问答常常依赖于图像或问题中缺失的知识。因此,小型视觉语言模型(small Vision-Language Models, sVLMs)如 ViLT、VisualBERT 和 FLAVA 在此类任务中落后于大型生成式模型。为研究精心集成常识知识对 sVLMs 影响,我们提出了端到端框架(NLKI),其包括(i)检索自然语言事实,(ii)引导 LLM 构建自然语言解释,(iii)分别将两者输入 sVLMs。我们在两个常识 VQA 数据集(CRIC、AOKVQA)和一个视觉蕴含数据集(e-SNLI-VE)上进行实验。使用微调后的 ColBERTv2 检索事实,结合带对象信息的提示,生成的解释大大减少了幻觉现象,同时将端到端答案准确率提升了最高 7%。这使得 FLAVA 等模型在 NLKI 中达到或超过中等规模 VLMs 如 Qwen-2 VL-2B 和 SmolVLM-2.5B。由于这些基准包含 10%-25% 标签噪声,采用鲁棒损失函数(如对称交叉熵和广义交叉熵)进行额外微调,可在 CRIC 上提升 2.5%,在 AOKVQA 上提升 5.5%。我们的发现揭示了 LLM 基于常识知识检索在何时优于从常识知识库检索、噪声感知训练如何稳定外部知识增强下的小模型,以及为何参数高效的常识推理现在已可实现 2.5 亿参数模型。

关键词

引用

@article{arxiv.2508.19724,
  title  = {NLKI: A lightweight Natural Language Knowledge Integration Framework for Improving Small VLMs in Commonsense VQA Tasks},
  author = {Aritra Dutta and Swapnanil Mukherjee and Deepanway Ghosal and Somak Aditya},
  journal= {arXiv preprint arXiv:2508.19724},
  year   = {2025}
}