面向法律文档的基于数据增强的联合跨度分割与修辞角色标注
计算与语言
2023-02-14 v1 信息检索
摘要
法律判决的分割与修辞角色标注在检索及相邻任务(包括案件摘要、语义搜索、论证挖掘等)中起着关键作用。先前的方法要么将该任务表述为独立的句子分类,要么表述为句子的序列标注。本工作中,我们在跨度级别上重新定义该任务,即识别共享相同修辞角色标注的多个连续句子所构成的跨度,并通过分类进行赋值。我们采用半马尔可夫条件随机场(CRF)联合学习跨度分割与跨度标注。我们进一步探索了三种数据增强策略,以缓解法律这一专业领域中的数据稀缺问题,其中单个文档往往很长且标注成本很高。我们的实验表明,在存在多句跨度的文档上,半马尔可夫 CRF 模型相对于 CRF 基线提升了跨度级预测指标。
引用
@article{arxiv.2302.06448,
title = {Joint Span Segmentation and Rhetorical Role Labeling with Data Augmentation for Legal Documents},
author = {T. Y. S. S. Santosh and Philipp Bock and Matthias Grabmair},
journal= {arXiv preprint arXiv:2302.06448},
year = {2023}
}
备注
Accepted to ECIR 2023