中文

用于从登记与法律文档中提取信息的序列到序列模型

人工智能 2022-01-19 v1 计算与语言

摘要

典型的信息提取流程由词元级或跨度级分类模型以及一系列前后处理脚本组成。在生产流程中,需求经常变化,类别被添加和移除,这导致对源代码的 nontrivial 修改以及可能引入缺陷。在本工作中,我们评估序列到序列模型作为词元级分类方法替代方案,用于法律和登记文档的信息提取。我们微调的模型联合提取信息并已在结构化格式中生成输出。后处理步骤在训练期间学习,从而消除了对基于规则的方法的需求并简化了流程。此外,我们提出了一种将输出与输入文本对齐的新方法,从而便于系统检查与审计。我们在四个真实世界数据集上的实验表明,所提方法是经典流程的一种替代方案。

关键词

引用

@article{arxiv.2201.05658,
  title  = {Sequence-to-Sequence Models for Extracting Information from Registration and Legal Documents},
  author = {Ramon Pires and Fábio C. de Souza and Guilherme Rosa and Roberto A. Lotufo and Rodrigo Nogueira},
  journal= {arXiv preprint arXiv:2201.05658},
  year   = {2022}
}