数据科学方法论在加尔各塔高等法院判决中的应用:基于LLM和RAG的高效框架用于概要生成与相似案件检索
信息检索
2025-07-03 v1 人工智能
机器学习
摘要
司法系统作为民主三柱之一,正面临日益增长的法律问题,需要谨慎运用司法资源。本研究提出了一个复杂的框架,利用数据科学方法,尤其是大语言模型(LLM)和检索增强生成(RAG)技术,来提高分析加尔各塔高等法院判决书的效率。我们的框架聚焦于两个关键方面:首先,创建健壮的概要生成机制,将复杂的法律文本提炼为简洁且连贯的概要;其次,开发一个智能系统用于检索相似案件,这将帮助法律专业人士进行研究和决策。通过对Pegasus模型进行微调,我们利用案件摘要实现了对法律案件概要生成的显著提升。我们的双步骤概要生成技术保留了关键的法律上下文,使能够生成用于RAG的综合向量数据库。该RAG框架能够高效检索相似案件,为用户查询提供详尽的概览和概要。该技术不仅提高了法律研究效率,也帮助法律专业人士和学生轻松获取和理解关键法律信息,为整个法律格局带来益处。
引用
@article{arxiv.2507.01058,
title = {A Data Science Approach to Calcutta High Court Judgments: An Efficient LLM and RAG-powered Framework for Summarization and Similar Cases Retrieval},
author = {Puspendu Banerjee and Aritra Mazumdar and Wazib Ansar and Saptarsi Goswami and Amlan Chakrabarti},
journal= {arXiv preprint arXiv:2507.01058},
year = {2025}
}
备注
12 pages, 6 figures