中文

PositionOCR:通过混合专家集成增强多模态模型中的位置感知能力

计算机视觉与模式识别 2026-02-24 v1

摘要

近年来,多模态大语言模型(MLLM)在基于OCR的视觉问答(VQA)任务中取得了强大的性能,展示了其处理异构数据并在不同情境中展现灵活性的能力。然而,这些MLLM依赖于大型语言模型(LLM)作为解码器,而LLM主要为语言处理设计,本质上缺乏用于精确视觉任务(如文本检测和文本定位)的位置推理能力。此外,MLLM的大量参数需要 substantial 计算资源和大规模数据才能有效训练。相反,文本检测专家在坐标预测方面实现了最佳性能,但缺乏语义推理能力。这一二分法激发了我们的关键研究问题:我们能否将专家的效率与LLM的上下文能力融合,以创建具位置精准性的MLLM?为克服这些挑战,我们引入PositionOCR,一个参数高效的混合架构,无缝集成文本检测模型的位置优势与LLM的上下文推理。该框架包含1310万可训练参数,展示了卓越的多模态处理能力,尤其在文本定位和文本检测任务中表现突出,始终超过传统MLLM。

关键词

引用

@article{arxiv.2602.19188,
  title  = {PositionOCR: Augmenting Positional Awareness in Multi-Modal Models via Hybrid Specialist Integration},
  author = {Chen Duan and Zhentao Guo and Pei Fu and Zining Wang and Kai Zhou and Pengfei Yan},
  journal= {arXiv preprint arXiv:2602.19188},
  year   = {2026}
}