勘测隐含表征:通过潜在表征探测 VLM 生成的 OCR 错误
计算机视觉与模式识别
2025-11-26 v1
摘要
随着视觉语言模型在安全关键型应用中的部署,其在不确定时选择不作答的能力对于可靠性尤为重要,尤其是在场景文本视觉问答(STVQA)任务中。例如,OCR 错误将“50 mph”误读为“60 mph”可能导致严重交通事故。这引发我们问:视觉语言模型是否能识别自身无法观察的情形?现有 abstention 方法建议悲观性回答:它们要么依赖误校准的输出概率,要么需要不适用于 OCR 任务的语义一致性。然而,这种失败可能表明我们正站在错误的入口:不确定性信号可能隐藏在视觉语言模型的内部表征中。基于这一洞见,我们提出潜在表征探测(LRP)方法:在隐藏状态或注意力模式上训练轻量级探测器。我们探讨了三种探测器设计:跨所有层拼接表征、聚合视觉标记的注意力、以及通过多数投票集成单层探测器。实验在图像和视频模态的四个基准数据集上显示,LRP 在最佳基线方法上提升了 7.6% 的 abstention 准确率。我们的分析揭示:探测器在各种不确定性来源和数据集之间具有良好泛化性,最优信号则来自中间层而非最终层。这为通过检测内部状态而非不可靠输出的置信度信号,构建面向部署的 AI 系统提供了原则性框架。
关键词
引用
@article{arxiv.2511.19806,
title = {Reading Between the Lines: Abstaining from VLM-Generated OCR Errors via Latent Representation Probes},
author = {Jihan Yao and Achin Kulshrestha and Nathalie Rauschmayr and Reed Roberts and Banghua Zhu and Yulia Tsvetkov and Federico Tombari},
journal= {arXiv preprint arXiv:2511.19806},
year = {2025}
}