视觉语言模型能否在生产环境中取代基于 OCR 的视觉问答管道?零售领域的案例研究
计算机视觉与模式识别
2024-08-29 v1
摘要
大多数面向生产环境的视觉问答(VQA)任务部署仍以独立步骤的处理管道构建,包括图像预处理、目标和文本检测、光学字符识别(OCR)和(主要是监督式)目标分类。然而,近期在视觉基础模型 [25] 和视觉语言模型(VLM) [23] 方面的进展引发了一个问题:这些自定义训练的、多步骤方法能否被预训练的、单步骤VLM取代?本文分析了在生产环境场景下,各种VLM在VQA和OCR [5, 9, 12] 任务中的性能与局限性。使用来自零售-786k [10] 数据集的数据,我们研究了预训练VLM回答广告产品图像中详细问题的能力。我们的研究包括两款商业模型,GPT-4V [16] 和 GPT-4o [17],以及四款开源模型:InternVL [5]、LLaVA 1.5 [12]、LLaVA-NeXT [13] 和 CogAgent [9]。我们的初始结果显示,开源模型和商业模型之间 generally 没有显著的性能差距。然而,我们观察到VLM性能在任务依赖性方面存在强烈差异:虽然大多数模型能够准确回答有关产品品牌和价格的问题,但它们在同一时间完全无法正确识别具体产品名称或折扣。这表明VLM在解决细粒度分类任务以及建模更抽象概念(如折扣)方面存在问题。
引用
@article{arxiv.2408.15626,
title = {Can Visual Language Models Replace OCR-Based Visual Question Answering Pipelines in Production? A Case Study in Retail},
author = {Bianca Lamm and Janis Keuper},
journal= {arXiv preprint arXiv:2408.15626},
year = {2024}
}