从可信度到可验证性:面向视觉语言模型的风险可控生成 OCR
计算机视觉与模式识别
2026-04-16 v3
摘要
现代视觉语言模型(VLM)可作为生成式 OCR 引擎,但开放式解码会暴露罕见但严重的错误。我们识别出生成式 OCR 的核心部署错位。自回归解码偏好语义可信度,而 OCR 需要输出在视觉上有依托且在几何上可验证。这种不匹配会产生严重错误,尤其是过度生成和不受支持的替换,即使在基准准确率保持较高时也会制造部署风险。因此,我们将冻结 VLM OCR 表述为选择性接受/放弃问题,提出一种模型无关的几何风险控制器。该控制器探测同一输入的多个结构化视图,应用轻量级结构筛选,仅当跨视图共识和稳定性满足预定义标准时才接受转录,从而产生一小族操作点。在冻结 VLM 主干模型和标准 OCR 基准测试上进行实验,结果显示在可预测的覆盖成本下,几何风险控制器一致降低了极端错误风险和灾难性过度生成。可靠地部署基于冻结 VLM 的生成式 OCR 需要显式的系统级风险控制,而非无约束的生成。
引用
@article{arxiv.2603.19790,
title = {From Plausibility to Verifiability: Risk-Controlled Generative OCR with Vision-Language Models},
author = {Weile Gong and Yiping Zuo and Zijian Lu and Xin He and Weibei Fan and Lianyong Qi and Shi Jin},
journal= {arXiv preprint arXiv:2603.19790},
year = {2026}
}
备注
10 pages, 5 figures, 5 tables