基于强化学习的高效医学视觉信息抽取
计算与语言
2025-06-17 v1
摘要
视觉信息抽取(VIE)将非结构化文档图像转换为JSON等结构化格式,对于报告分析和在线咨询等医学应用至关重要。传统方法依赖OCR和语言模型,而端到端多模态模型可直接生成JSON。然而,特定领域的模式和高昂的标注成本限制了它们在医学VIE中的有效性。我们基于可验证奖励强化学习(RLVR)框架提出方法,仅使用100个标注样本即可应对这些挑战。我们的方法确保了数据集多样性、平衡的精确率-召回率奖励机制以减少幻觉并提高字段覆盖率,以及创新的采样策略以增强推理能力。使用我们的RLVR方法微调Qwen2.5-VL-7B,我们在医学VIE任务上取得了最先进的性能,显著提高了F1分数、精确率和召回率。虽然我们的模型在与医学数据集相似的任务上表现出色,但在不相似的任务上性能下降,凸显了领域特定优化的必要性。案例研究进一步证明了在VIE的训练和推理过程中进行推理的价值。
引用
@article{arxiv.2506.13363,
title = {Efficient Medical VIE via Reinforcement Learning},
author = {Lijun Liu and Ruiyang Li and Zhaocheng Liu and Chenglin Zhu and Chong Li and Jiehan Cheng and Qiang Ju and Jian Xie},
journal= {arXiv preprint arXiv:2506.13363},
year = {2025}
}