Text-VQA Aug:大型多模态模型用于自动合成的流水线方法
计算机视觉与模式识别
2025-11-05 v1 人工智能
摘要
创建涉及场景文本数据的视觉问答任务(text-VQA)的大规模数据库需要巧妙的人类标注,这既费时又具挑战性。随着处理视觉和语言模态的基础模型的出现,以及 OCR 系统的成熟,迫切需要建立一个能够从给定图像中合成基于场景文本的问答对(QA)的端到端流水线。我们提出了一个用于 text-VQA 数据集自动合成的流水线,能够产生可靠的 QA 对,并且能够随场景文本数据的可用性而扩展。我们的方法利用了多个模型和算法,包括 OCR 检测和识别(文本检测)、感兴趣区域(ROI)检测、描述生成和问句生成。这些组件被整合成一个连贯的流水线,以自动化合成和验证 QA 对。就我们所知,这是第一个自动合成和验证大规模 text-VQA 数据集的流水线,约包含 72K 个 QA 对,基于约 44K 张图像。
引用
@article{arxiv.2511.02046,
title = {Text-VQA Aug: Pipelined Harnessing of Large Multimodal Models for Automated Synthesis},
author = {Soham Joshi and Shwet Kamal Mishra and Viswanath Gopalakrishnan},
journal= {arXiv preprint arXiv:2511.02046},
year = {2025}
}
备注
First two authors contributed equally