InstructOCR:指令增强的场景文本检测
计算机视觉与模式识别
2025-01-14 v2 人工智能
摘要
在场景文本检测领域,以往的 OCR 方法主要依赖图像编码器和预训练文本信息,但往往忽略了融入人类语言指令的优势。为了弥补这一不足,我们提出了 InstructOCR,一种创新的基于指令的场景文本检测模型,该模型利用人类语言指令来增强对图像中文本的理解。我们的框架在训练和推理过程中同时使用文本和图像编码器,以及根据文本属性精心设计的指令。这种方法使模型能够更准确、更灵活地解读文本。大量实验证明了我们模型的有效性,并且我们在广泛使用的基准上取得了最先进的结果。此外,所提框架可无缝应用于场景文本 VQA 任务。通过在预训练中利用指令策略,下游 VQA 任务的性能可以得到显著提升,在 TextVQA 数据集上提升了 2.6%,在 ST-VQA 数据集上提升了 2.1%。这些实验结果为将人类语言指令融入 OCR 相关任务的好处提供了见解。
引用
@article{arxiv.2412.15523,
title = {InstructOCR: Instruction Boosting Scene Text Spotting},
author = {Chen Duan and Qianyi Jiang and Pei Fu and Jiamin Chen and Shengxi Li and Zining Wang and Shan Guo and Junfeng Luo},
journal= {arXiv preprint arXiv:2412.15523},
year = {2025}
}
备注
Accepted by AAAI2025