中文

利用开源模型进行法律语言建模与分析:以印度宪法为例

计算机与社会 2024-04-11 v1

摘要

近年来,开源模型在各个领域越来越受欢迎,包括法律语言建模和分析。这些模型已被证明在总结法律文件、提取关键信息甚至预测案件结果等任务中非常有效。这彻底改变了法律行业,使律师、研究人员和政策制定者能够快速访问和分析大量法律文本,节省时间和资源。本文提出了一种使用Hugging Face开源模型进行法律语言建模(LLM)和分析的新方法。我们通过LangChain和Sentence Transformers利用Hugging Face嵌入,开发了一个针对法律文本定制的LLM。然后,我们通过从印度官方宪法中提取见解来演示该模型的应用。我们的方法包括预处理数据、将其分割成块、使用ChromaDB和LangChainVectorStores,以及采用Google/Flan-T5-XXL模型进行分析。训练后的模型在PDF格式的印度宪法上进行了测试。我们的研究结果表明,我们的方法有望实现高效的法律语言处理和分析。

关键词

引用

@article{arxiv.2404.06751,
  title  = {Leveraging open-source models for legal language modeling and analysis: a case study on the Indian constitution},
  author = {Vikhyath Gupta and Srinivasa Rao P},
  journal= {arXiv preprint arXiv:2404.06751},
  year   = {2024}
}

备注

10 Pages , 3 figures