中文

从难辨手写文档图像中的弱监督信息抽取

计算机视觉与模式识别 2023-06-13 v1 计算与语言

摘要

最先进的信息抽取方法受限于 OCR 错误。它们在表单式文档的印刷文本上表现良好,但非结构化手写文档仍具挑战性。将现有模型适配至特定领域训练数据颇为昂贵,原因有二:1) 特定领域文档(如手写处方、实验记录等)可用量有限;2) 标注变得更加困难,因为需要特定领域知识来解码难辨的手写文档图像。本工作中,我们聚焦于仅使用弱标签数据从手写处方中抽取药名的复杂问题。数据由图像及其所含药名列表组成,但不包含药名在图像中的位置。我们通过首先从仅有的弱标签中识别感兴趣区域(即药方行),然后注入仅使用合成生成数据学习到的特定领域药物语言模型来解决该问题。与现成的先进方法相比,我们的方法在处方药名抽取上的性能优于其 2.5 倍以上。

关键词

引用

@article{arxiv.2306.06823,
  title  = {Weakly supervised information extraction from inscrutable handwritten document images},
  author = {Sujoy Paul and Gagan Madan and Akankshya Mishra and Narayan Hegde and Pradeep Kumar and Gaurav Aggarwal},
  journal= {arXiv preprint arXiv:2306.06823},
  year   = {2023}
}

备注

Accepted at ICDAR 2023