面向统计法律分析的数据高效端到端信息抽取
计算与语言
2022-11-04 v1
摘要
法律从业者常面对海量文档。例如,律师为其客户搜寻有利先例,而法律先例的数量持续增长。尽管法律搜索引擎可协助查找个别目标文档并缩减候选数量,但检索信息常以非结构化文本呈现,用户须逐一细查,可能导致信息过载。这也使其统计分析颇具挑战。为此,我们提出一种面向法律文档的端到端信息抽取(IE)系统。通过将 IE 表述为生成任务,我们的系统无需领域特定工程即可轻松应用于各类任务。针对韩国先例的四个 IE 任务的实验结果表明,每任务仅用 50 个训练样本时,我们的 IE 系统相较基于规则的基线可达胜任分数(平均 -2.3),而用 200 个样本时分数更高(平均 +5.4)。最后,我们对两类案件——酒驾与欺诈——共 35k 先例的统计分析显示,由我们的 IE 系统所得结构化信息忠实反映了韩国法律体系的宏观特征。
引用
@article{arxiv.2211.01692,
title = {Data-efficient End-to-end Information Extraction for Statistical Legal Analysis},
author = {Wonseok Hwang and Saehee Eom and Hanuhl Lee and Hai Jin Park and Minjoon Seo},
journal= {arXiv preprint arXiv:2211.01692},
year = {2022}
}
备注
NLLP workshop @ EMNLP 2022