中文

探索大型视觉语言模型生成描述的独特性和保真度

计算机视觉与模式识别 2024-04-29 v1 多媒体

摘要

大型视觉语言模型(LVLMs)因其处理和整合视觉与文本数据的卓越能力而日益受到关注。尽管它们很受欢迎,但LVLMs生成精确、细粒度文本描述的能力尚未得到充分探索。本研究通过关注“独特性”和“保真度”来填补这一空白,评估了Open-Flamingo、IDEFICS和MiniGPT-4等模型如何区分相似对象并准确描述视觉特征。我们提出了文本检索增强分类(TRAC)框架,通过利用其生成能力,使我们能够更深入地分析细粒度视觉描述生成。这项研究为LVLMs的生成质量提供了宝贵的见解,增强了对多模态语言模型的理解。值得注意的是,MiniGPT-4在生成细粒度描述方面表现突出,在这方面优于其他两个模型。代码可在\url{https://anonymous.4open.science/r/Explore_FGVDs-E277}获取。

关键词

引用

@article{arxiv.2404.17534,
  title  = {Exploring the Distinctiveness and Fidelity of the Descriptions Generated by Large Vision-Language Models},
  author = {Yuhang Huang and Zihan Wu and Chongyang Gao and Jiawei Peng and Xu Yang},
  journal= {arXiv preprint arXiv:2404.17534},
  year   = {2024}
}

备注

11 pages, 9 figures, 6 tables. For associated code, see https://anonymous.4open.science/r/Explore_FGVDs-E277