DALE:面向低资源法律 NLP 的生成式数据增强
计算与语言
2023-10-25 v1 人工智能
摘要
我们提出 DALE,一种新颖且高效的面向低资源法律 NLP 的生成式数据增强框架。DALE 解决了现有框架在为法律文档生成有效数据增强时所面临的挑战——法律语言具有专业词汇及复杂的语义、形态与句法,仅对源句改写的数据增强并无裨益。为此,DALE 基于编码器-解码器语言模型构建,并在一种基于选择性掩码的新型无监督文本去噪目标上预训练——我们的掩码策略利用模板化法律文档的域特定语言特征来掩码共现文本片段。对这些片段去噪有助于 DALE 获取法律概念、原则与语言用法的知识。由此,它发展出生成具有新颖语境且连贯多样的增强样本的能力。最后,DALE 执行条件生成以为低资源法律 NLP 任务合成增强样本。我们在跨越 6 项任务与 4 种低资源设置的 13 个数据集上证明了 DALE 的有效性。DALE 在定性与定量上均优于包括 LLM 在内的所有基线,提升幅度为 1%–50%。
引用
@article{arxiv.2310.15799,
title = {DALE: Generative Data Augmentation for Low-Resource Legal NLP},
author = {Sreyan Ghosh and Chandra Kiran Evuru and Sonal Kumar and S Ramaneswaran and S Sakshi and Utkarsh Tyagi and Dinesh Manocha},
journal= {arXiv preprint arXiv:2310.15799},
year = {2023}
}
备注
Accepted to EMNLP 2023 Main Conference. Code: https://github.com/Sreyan88/DALE