MAUD:面向合并协议理解的专家标注法律自然语言处理数据集
计算与语言
2023-11-27 v3
摘要
由于法律条款篇幅长、复杂度高且缺乏专家标注数据集,法律文本的阅读理解可能是一项尤其具有挑战性的任务。为应对这一挑战,我们引入了合并协议理解数据集(Merger Agreement Understanding Dataset,MAUD),这是一个基于美国律师协会2021年公开目标交易要点研究的专家标注阅读理解数据集,包含超过39,000个样本和超过47,000条标注。我们微调的Transformer基线模型展现出有前景的结果,在大多数问题上模型表现远优于随机水平。然而,在很大一部分子集问题上仍有显著提升空间。作为唯一的专家标注合并协议数据集,MAUD对于法律界和自然语言处理(NLP)社区而言都是极具价值的基准。
引用
@article{arxiv.2301.00876,
title = {MAUD: An Expert-Annotated Legal NLP Dataset for Merger Agreement Understanding},
author = {Steven H. Wang and Antoine Scardigli and Leonard Tang and Wei Chen and Dimitry Levkin and Anya Chen and Spencer Ball and Thomas Woodside and Oliver Zhang and Dan Hendrycks},
journal= {arXiv preprint arXiv:2301.00876},
year = {2023}
}
备注
EMNLP 2023. 5 pages + appendix. Code and dataset are available at https://github.com/TheAtticusProject/maud