LLM 法律语言的归因分析
机器学习
2025-01-30 v1 计算与语言
摘要
我们实现了三款专为法律任务设计的公开大型语言模型(LLM),并表明在法律语料库上进行训练可提升分类准确率,但为何及如何实现这一点仍需探究。我们使用两套公开法律数据集进行实验:一种是简单二分类任务("overruling"文本),另一种是更复杂的多选任务(识别"holding"司法决策)。我们报告了将法律 LLM 与通用 BERT 模型进行比较的实验结果,针对两个数据集进行测试。我们采用集成梯度归因技术来推断模型性能变化的"原因",并根据各自的 tokenization 方法进行特征描述。我们发现尽管所有模型在 casehold 任务中能正确分类一些测试样本,但其他样本只能由单一模型识别,归因可用于突出这些差异的原因。我们发现模型 tokenizer 的差异性解释了大多数差异,并以处理的法律语言为依据分析这些差异。结合数据集文本中 token 频率分析与已知"停词"列表的使用,可识别出明确指向法律主题的 token。
引用
@article{arxiv.2501.17330,
title = {Attribution analysis of legal language as used by LLM},
author = {Richard K. Belew},
journal= {arXiv preprint arXiv:2501.17330},
year = {2025}
}
备注
9 pages, 17 figures