利用大型语言模型 (LLM) 的随机性在文本分类任务中:在法律事务中定位特权文件
信息检索
2025-12-10 v1
摘要
在法律事务中,文本分类模型最常用于通过大型数据集筛选,以查找满足某些预先选定标准的文件,如特定主题的相关性文件,例如特权通信和律师指定文件。在此背景下,大型语言模型已显示出强大的性能。本文提出了一项实证研究,探讨了 LLM 基于分类中随机性的作用,重点关注四个关键维度:(1) LLM 在识别受特权保护文件方面的有效性,(2) 随机性控制参数对分类输出的影响,(3) 其对整体分类性能的影响,以及 (4) 一种利用随机性来提高准确性的方法论。实验结果显示,LLM 能够有效识别受特权保护的文件,随机性控制参数对分类性能影响有限,重要的是,我们开发的方法论能够显著提高准确性。值得注意的是,这种利用随机性的方法论还能在纳入其制裁合规流程时,提高组织对 LLM 输出的信心。随着组织越来越多地依赖 LLM 来增强合规工作流程,减少输出变异性有助于建立对 LLM 生成的制裁筛查决策的内部和监管信心。
引用
@article{arxiv.2512.08083,
title = {Exploiting the Randomness of Large Language Models (LLM) in Text Classification Tasks: Locating Privileged Documents in Legal Matters},
author = {Keith Huffman and Jianping Zhang and Nathaniel Huber-Fliflet and Fusheng Wei and Peter Gronvall},
journal= {arXiv preprint arXiv:2512.08083},
year = {2025}
}