中文

向黑箱低语:基于视觉提示的冻结 OCR 引导框架

机器学习 2026-03-06 v1 人工智能

摘要

在现代机器学习领域中,冻结预训练模型提供了稳定性和效率优势,但常因数据分布不匹配而在特定任务上表现不佳。本文引入Whisperer,一种新型视觉提示框架,通过学习基于扩散的预处理器在像素空间调整输入,有效地向冻结的下游模型(如EasyOCR)“低语”式地提升其性能。我们将其过程建模为随机发现改进策略的行为克隆。该方法在30万个退化合成文本图像的数据集上,将字符错误率(CER)降低了8个百分点(约10.6%的相对降幅),超越了CLAHE等手工设计的基线。核心创新在于一个四阶段训练课程,利用行为克隆放大通过部分训练扩散模型的随机探索中发现的“幸运”改进。该方法高度样本高效,避免了传统强化学习的诸多陷阱。关键在于,我们将其不建模为粗暴的强化学习,而是作为一个探索策略的行为克隆:我们随机抽取中间扩散输出,筛选出能降低CER的随机改进,然后训练模型复现这些改进。这个引导课程(4个阶段,60个GPU小时)将随机成功放大为系统性策略。总结来说,通过在输入端向冻结的OCR“低语”,我们在不修改模型权重的情况下提升了一个不完美的分类器。

关键词

引用

@article{arxiv.2603.05276,
  title  = {Whispering to a Blackbox: Bootstrapping Frozen OCR with Visual Prompts},
  author = {Samandar Samandarov and Nazirjon Ismoiljonov and Abdullah Sattorov and Temirlan Sabyrbayev},
  journal= {arXiv preprint arXiv:2603.05276},
  year   = {2026}
}