中文

大文档定律:利用视觉线索理解法律合同的结构

计算与语言 2021-07-20 v1

摘要

像BERT这样的大型预训练transformer模型在文档理解任务上取得了最先进的结果,但大多数实现一次只能处理512个token。对于许多实际应用,文档可能长得多,而长文档上通常使用的分段策略会遗漏文档结构与上下文信息,损害其在下游任务上的结果。在我们关于法律协议的工作中,我们发现文档中的版式、样式和文本位置等视觉线索是强有力的特征,对于在长文档上达到可接受的准确度至关重要。我们衡量了通过计算机视觉方法获得的此类视觉线索的引入,对包括文档分段、实体抽取和属性分类在内的文档理解任务准确度的影响。我们基于结构元数据分割文档的方法,在Contract Understanding Atticus Dataset上衡量的四项长文档理解任务中优于现有方法。

关键词

引用

@article{arxiv.2107.08128,
  title  = {The Law of Large Documents: Understanding the Structure of Legal Contracts Using Visual Cues},
  author = {Allison Hegel and Marina Shah and Genevieve Peaslee and Brendan Roof and Emad Elwany},
  journal= {arXiv preprint arXiv:2107.08128},
  year   = {2021}
}