中文

弥合视觉鸿沟:用知识适配字幕微调多模态模型

计算机视觉与模式识别 2025-08-13 v4 计算与语言 机器学习

摘要

近期研究越来越多地关注用长而详细的图像字幕训练视觉-语言模型(VLM)。然而,小规模VLM在微调时往往难以平衡这些字幕的丰富性与幻觉内容的风险。本文探讨了VLM对这类字幕的适应程度。为量化字幕质量,我们提出了分解NLI (DNLI),一种将生成的字幕分解为单个命题并单独评估的评估框架。这种细粒度分析揭示了捕捉描述性细节与防止幻觉之间的关键平衡。我们的发现表明,单纯降低字幕复杂度或采用标准数据清洗技术无法有效解决这一问题。为应对这一挑战,我们引入了知识适配(KnowAda)微调,一种以数据为中心的方法,能自动利用模型现有的知识和视觉理解来适配训练数据。KnowAda在保持高描述性的同时最小化幻觉。我们在多个小规模VLM(高达70亿参数)和稠密字幕数据集上验证了该方法,证明KnowAda能有效平衡幻觉减少与描述性。结果显示,KnowAda在自动指标和人工评估中均优于各种基线。我们将发布代码和模型。

关键词

引用

@article{arxiv.2411.09018,
  title  = {Bridging the Visual Gap: Fine-Tuning Multimodal Models with Knowledge-Adapted Captions},
  author = {Moran Yanuka and Assaf Ben Kish and Yonatan Bitton and Idan Szpektor and Raja Giryes},
  journal= {arXiv preprint arXiv:2411.09018},
  year   = {2025}
}

备注

Accepted to NAACL 2025