PixLore:一种数据集驱动的丰富图像描述生成方法
计算机视觉与模式识别
2024-10-24 v3 人工智能
摘要
在视觉-语言集成领域,由于缺乏经过精心整理的丰富数据集,生成详细的图像描述构成了重大挑战。本研究引入了 PixLore,这是一种新颖的方法,通过在标准商用 GPU 上使用 LoRa 方法微调 BLIP-2 模型来利用 Querying Transformers。所采用的方法包括在一个精心构建的数据集上进行训练,该数据集由最先进的计算机视觉模型组合而成并经 ChatGPT 增强,旨在解决能否通过小规模模型集合(称为知识拼接)实现复杂图像理解的问题。与 GPT-4 和 Google Bard 等主要模型的对比评估表明,PixLore-2.7B 尽管参数数量少得多,但在超过一半的评估中被评为优于现有的 State-of-the-Art 模型。具体而言,在图像描述生成任务中,PixLore 的表现优于 Bard 和 BLIP-2,后两者的得分分别比 PixLore 低约 35.18% 和 27.98%。这项研究不仅提出了一种开创性的方法,还突出了精心整理的数据集在提升小模型性能方面的重要性。
引用
@article{arxiv.2312.05349,
title = {PixLore: A Dataset-driven Approach to Rich Image Captioning},
author = {Diego Bonilla-Salvador and Marcelino Martínez-Sober and Joan Vila-Francés and Antonio José Serrano-López and Pablo Rodríguez-Belenguer and Fernando Mateo},
journal= {arXiv preprint arXiv:2312.05349},
year = {2024}
}
备注
Paper in preprint pending of publication