中文

探索面向双语VQA的OCR增强生成

计算机视觉与模式识别 2025-10-06 v1

摘要

我们研究了利用视觉语言模型(VLMs)进行OCR增强生成,探索韩语和英语任务以实现多语言化。为了支持该领域的研究,我们训练并发布了KLOCR,一个在1亿个实例上训练的强双语OCR基线,用于增强VLMs的OCR能力。为了补充现有的VQA基准,我们整理了KOCRBench用于韩语VQA,并分析了不同的提示方法。大量实验表明,OCR提取的文本显著提升了开源和商业模型的性能。我们的工作为双语VQA的OCR增强生成提供了新见解。模型、代码和数据可在https://github.com/JHLee0513/KLOCR获取。

关键词

引用

@article{arxiv.2510.02543,
  title  = {Exploring OCR-augmented Generation for Bilingual VQA},
  author = {JoonHo Lee and Sunho Park},
  journal= {arXiv preprint arXiv:2510.02543},
  year   = {2025}
}