中文

Patchfinder:利用视觉语言模型的不确定性实现精确信息检索

计算机视觉与模式识别 2024-12-17 v3

摘要

数十年来,企业和政府都依赖扫描文档来记录大量信息。然而,由于文档量庞大且复杂,这些信息的提取过程缓慢且繁琐。视觉语言模型(VLMs)的兴起为高效且准确地从这些文档中提取信息提供了一种方法。当前的自动化工作流程通常需要两种步骤:首先使用光学字符识别软件提取信息,然后使用大型语言模型对该信息进行处理。不幸的是,这些方法在处理噪声扫描文档时面临重大挑战,往往需要计算昂贵的语言模型来有效处理高信息密度。本研究提出了 PatchFinder 算法,基于 VLMs 提高信息提取。首先,我们基于 VLMs 输出的 Maximum Softmax Probability 设计了一种称为 Patch Confidence 的置信度评分,以衡量模型对其预测的置信度。使用该指标,PatchFinder 确定合适的 patch 大小,将输入文档划分为重叠的 patch,并为目标信息生成基于置信度的预测。我们的实验结果表明,PatchFinder 利用参数为 4.2 亿的 Phi-3v achieves 在 190 份噪声扫描文档的数据集上实现 94% 的准确率,超过 ChatGPT-4o 高出 18.5 个百分点。

关键词

引用

@article{arxiv.2412.02886,
  title  = {Patchfinder: Leveraging Visual Language Models for Accurate Information Retrieval using Model Uncertainty},
  author = {Roman Colman and Minh Vu and Manish Bhattarai and Martin Ma and Hari Viswanathan and Daniel O'Malley and Javier E. Santos},
  journal= {arXiv preprint arXiv:2412.02886},
  year   = {2024}
}

备注

This paper has been accepted to IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2025