中文

面向文档图像分类的基于规则的强化学习方法

计算机视觉与模式识别 2025-11-27 v1

摘要

随着DeepSeek-R1通过简单可验证奖励展示了其成功,基于规则的强化学习正日益受到关注。在文档分析领域,尽管许多下游任务可能受益于强化学习的新兴特性,特别是增强的推理能力,但强化学习并不像其他领域那样普遍。我们研究了在文档图像分类这一任务上的基于规则的强化学习效果,该任务是文档分析中最常研究的下游任务之一。我们发现,强化学习在面对分布外数据的泛化能力方面表现更好,我们在三个不同的场景中进行了考察,分别是分布外图像、未见类别和不同模态。我们的代码可在https://github.com/jungomi/vision-finetune获得。

关键词

引用

@article{arxiv.2509.22283,
  title  = {Rule-Based Reinforcement Learning for Document Image Classification with Vision Language Models},
  author = {Michael Jungo and Andreas Fischer},
  journal= {arXiv preprint arXiv:2509.22283},
  year   = {2025}
}

备注

Code available at https://github.com/jungomi/vision-finetune