中文

KAP:MLLM 辅助 OCR 文本增强用于中文非叙事文档的混合检索

信息检索 2025-05-02 v3

摘要

结合稀疏检索与密集检索的混合检索系统,由于中文非叙事文档复杂的格式、丰富的词汇以及通用嵌入模型对中文同义词理解不足而面临挑战。先前的方法未能充分满足这些系统的双重需求,主要关注通用文本质量提升而非针对检索进行优化。我们提出了一种名为知识感知预处理(KAP)的新型框架,将含噪声的 OCR 输出转换为检索优化的文本。KAP 采用两阶段方法:首先通过 OCR 提取文本,然后利用多模态大语言模型通过整合原始文档中的视觉信息来优化输出。该设计减少了 OCR 噪声,重建了结构元素,并将文本格式化以满足稀疏检索和密集检索的不同需求。实验结果表明,KAP 持续且显著地优于传统的预处理方法。我们的代码可在 https://github.com/JustinHsu1019/KAP 获取。

关键词

引用

@article{arxiv.2503.08452,
  title  = {KAP: MLLM-assisted OCR Text Enhancement for Hybrid Retrieval in Chinese Non-Narrative Documents},
  author = {Hsin-Ling Hsu and Ping-Sheng Lin and Jing-Di Lin and Jengnan Tzeng},
  journal= {arXiv preprint arXiv:2503.08452},
  year   = {2025}
}