探索面向双语VQA的OCR增强生成
计算机视觉与模式识别
2025-10-06 v1
摘要
我们研究了利用视觉语言模型(VLMs)进行OCR增强生成,探索韩语和英语任务以实现多语言化。为了支持该领域的研究,我们训练并发布了KLOCR,一个在1亿个实例上训练的强双语OCR基线,用于增强VLMs的OCR能力。为了补充现有的VQA基准,我们整理了KOCRBench用于韩语VQA,并分析了不同的提示方法。大量实验表明,OCR提取的文本显著提升了开源和商业模型的性能。我们的工作为双语VQA的OCR增强生成提供了新见解。模型、代码和数据可在https://github.com/JHLee0513/KLOCR获取。
引用
@article{arxiv.2510.02543,
title = {Exploring OCR-augmented Generation for Bilingual VQA},
author = {JoonHo Lee and Sunho Park},
journal= {arXiv preprint arXiv:2510.02543},
year = {2025}
}