基于弱监督目标检测的法律文档复杂命名实体抽取
信息检索
2023-05-11 v1
摘要
准确的命名实体识别(NER)对工业界多种信息检索任务至关重要。然而,尽管传统 NER 方法已取得显著进展,复杂命名实体的抽取仍属相对未充分探索的领域。本文提出一种新颖系统,将用于文档版式分析(DLA)的目标检测与弱监督学习相结合,以应对法律文档中不连续复杂命名实体的抽取挑战。值得注意的是,据我们所知,这是首个将弱监督应用于 DLA 的工作。实验结果表明,在金标准数据有限时,仅以伪标签训练的模型优于有监督基线,凸显了我们所提方法在降低对标注数据依赖方面的有效性。
引用
@article{arxiv.2305.05836,
title = {Extracting Complex Named Entities in Legal Documents via Weakly Supervised Object Detection},
author = {Hsiu-Wei Yang and Abhinav Agrawal},
journal= {arXiv preprint arXiv:2305.05836},
year = {2023}
}