MeDocVL:用于医学文档理解与解析的视觉语言模型
计算机视觉与模式识别
2026-02-09 v1
摘要
医学文档OCR由于复杂的版面结构、领域特定术语和噪声标注,以及对字段级别的严格匹配要求,备受挑战。现有OCR系统和通用视觉语言模型往往难以可靠地解析此类文档。我们提出MeDocVL,一个针对查询驱动的医学文档解析的后训练视觉语言模型。我们的框架结合训练驱动的标签细化以构建来自噪声标注的高质量监督信号,以及融合强化学习和监督微调的噪声感知混合后训练策略,以实现稳健且精确的提取。在医学发票基准测试上进行的实验表明,MeDocVL consistently 超越了常规OCR系统和强大的VLM基线,实现了在噪声监督下的领先性能。
引用
@article{arxiv.2602.06402,
title = {MeDocVL: A Visual Language Model for Medical Document Understanding and Parsing},
author = {Wenjie Wang and Wei Wu and Ying Liu and Yuan Zhao and Xiaole Lv and Liang Diao and Zengjian Fan and Wenfeng Xie and Ziling Lin and De Shi and Lin Huang and Kaihe Xu and Hong Li},
journal= {arXiv preprint arXiv:2602.06402},
year = {2026}
}
备注
20 pages, 8 figures. Technical report