中文

利用视觉语言模型实现知识丰富图像描述的束引导知识重放

计算机视觉与模式识别 2025-05-30 v1

摘要

生成信息丰富且知识丰富的图像描述对许多现有的描述模型而言仍是一项挑战,这些模型通常生成缺乏特异性和语境深度的通用描述。为了解决这一局限性,我们提出了 KRCapVLM,这是一个基于知识重放的新型图像描述框架,使用视觉语言模型。我们结合束搜索解码以生成更多样且连贯的描述。我们还将基于注意力的模块集成到图像编码器中,以增强特征表示。最后,我们采用训练调度器来提高稳定性并确保训练期间更平滑的收敛。这些提议在描述质量和知识识别方面均带来了显著提升。我们提出的模型在知识识别的准确性和生成描述的整体质量上均展现出明显的改进。它显示出更强的泛化到未见知识概念的能力,能够生成更具信息量和语境相关性的描述。这些结果表明了我们的方法在增强模型跨各种场景生成有意义、知识驱动的描述能力方面的有效性。

关键词

引用

@article{arxiv.2505.23358,
  title  = {Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model},
  author = {Reem AlJunaid and Muzammil Behzad},
  journal= {arXiv preprint arXiv:2505.23358},
  year   = {2025}
}