中文

HLDC: Hindi法律文档语料库

计算与语言 2024-05-27 v2 人工智能 机器学习

摘要

包括印度在内的许多人口大国都背负着相当数量的法律案件积压。开发能够处理法律文档并辅助法律从业者的自动化系统可缓解此问题。然而,开发此类数据驱动系统所需的高质量语料库十分匮乏。对于如Hindi这样的低资源语言,问题更为突出。在本资源论文中,我们介绍了Hindi法律文档语料库(HLDC),一个包含超过90万份Hindi法律文档的语料库。文档经过清洗与结构化以支撑下游应用的开发。此外,作为该语料库的一个用例,我们引入了保释预测任务。我们使用了一系列模型进行实验,并针对该任务提出了一种基于多任务学习(MTL)的模型。MTL模型将摘要生成作为辅助任务,保释预测作为主任务。不同模型的实验表明该领域仍需进一步研究。我们随本文发布了语料库与模型实现代码:https://github.com/Exploration-Lab/HLDC

关键词

引用

@article{arxiv.2204.00806,
  title  = {HLDC: Hindi Legal Documents Corpus},
  author = {Arnav Kapoor and Mudit Dhawan and Anmol Goel and T. H. Arjun and Akshala Bhatnagar and Vibhu Agrawal and Amul Agrawal and Arnab Bhattacharya and Ponnurangam Kumaraguru and Ashutosh Modi},
  journal= {arXiv preprint arXiv:2204.00806},
  year   = {2024}
}

备注

16 Pages, Accepted at ACL 2022 Findings