PL-CA:面向法律案例的数据增强框架
计算与语言
2025-09-09 v1 人工智能
摘要
传统的检索增强生成(RAG)方法被认为是解决模型知识不足和幻觉问题最有效的方法,尤其是在那些需要高水平知识严谨性、逻辑一致性和内容完整性的司法领域。然而,传统的RAG方法仅将检索到的文档直接注入模型的上下文,这严重限制了模型,因为其上下文窗口有限,并且通过过长的上下文引入额外的计算开销,从而干扰模型的注意力机制并降低下游任务的性能。此外,许多现有基准缺乏专家标注,仅关注单个下游任务,而现实中的法律场景由多种混合法律任务组成,这表明传统基准不足以反映模型的真实能力。为此,我们提出PL-CA,通过引入参数化RAG(P-RAG)框架对语料库知识进行数据增强,并将这种法律知识编码为参数化向量,然后通过LoRA将这些参数化知识集成到LLM的前馈网络(FFN)中,从而减轻模型的上下文压力。此外,我们还构建了一个包含超过2000个训练和测试实例的多任务法律数据集,所有实例均由专家标注并经过人工验证。我们在该数据集上进行实验,实验结果表明,我们的方法在保持与传统RAG相当的下游任务性能的同时,减少了过长上下文带来的开销。我们的代码和数据集均提供于附录中。
引用
@article{arxiv.2509.06356,
title = {PL-CA: A Parametric Legal Case Augmentation Framework},
author = {Ao Chang and Yubo Chen and Jun Zhao},
journal= {arXiv preprint arXiv:2509.06356},
year = {2025}
}