印度法律文本摘要:一种基于文本归一化的方法
计算与语言
2023-02-20 v2
摘要
在印度法院系统中,案件积压长期存在问题。未决案件超过 4 crore 件。对法律相关者而言,手动摘要数百份文件耗时且繁琐。随着机器学习的发展,许多最先进的文本摘要模型已经出现。领域无关模型在法律文本上表现不佳,且由于缺乏公开可用数据集,针对印度法律体系微调这些模型存在困难。为提升领域无关模型的性能,作者提出了一种在印度语境下归一化法律文本的方法。作者用两个最先进的领域无关法律文本摘要模型即 BART 与 PEGASUS 进行实验。BART 与 PEGASUS 在抽取式与生成式摘要方面接受充分检验,以理解文本归一化方法的有效性。摘要文本由领域专家按多参数并使用 ROUGE 度量评估。结果表明所提文本归一化方法在结合领域无关模型处理法律文本时是有效的。
引用
@article{arxiv.2206.06238,
title = {Indian Legal Text Summarization: A Text Normalisation-based Approach},
author = {Satyajit Ghosh and Mousumi Dutta and Tanaya Das},
journal= {arXiv preprint arXiv:2206.06238},
year = {2023}
}
备注
Preprint. Accepted at 2022 IEEE 19th India Council International Conference (INDICON)