中文

图像嵌入采样方法用于多样化描述

计算机视觉与模式识别 2025-09-05 v2 人工智能

摘要

尽管图像描述技术为最新视觉-语言模型(VLM)带来了显著提升,但其计算复杂度的增加使得其在移动设备和辅助技术等资源受限的应用场景中不够友好。另一方面,较小规模的VLM往往仅关注高层场景描述,忽略了贡献于更丰富理解的细节信息。本文引入一种无需额外训练的训练框架,通过显式关注图像的不同区域来增强描述的多样性和信息量,同时采用规模较小的VLM(如BLIP)作为骨干网络。该方法利用结构化分段生成分层表示,捕获全局与局部语义。无需额外模型训练,我们展示了该方法使较小规模的VLM在图像-描述对齐性、语义完整性和多样性方面可与大型模型相当。在MSCOCO、Flickr30k和Nocaps测试数据集上,我们分别实现了Div-2得分达到0.735、0.750和0.748,同时保持与人工标注描述的强相关性和语义完整性。

关键词

引用

@article{arxiv.2502.10118,
  title  = {Image Embedding Sampling Method for Diverse Captioning},
  author = {Sania Waheed and Na Min An},
  journal= {arXiv preprint arXiv:2502.10118},
  year   = {2025}
}

备注

17 pages, 5 figures, 9 tables