中文

遮蔽,还是不遮蔽?面向审议过程特权分类的本地 LLM 方法

计算与语言 2026-05-12 v1 人工智能 信息检索

摘要

政府透明度法律,如美国和英国的《信息自由法》(FOIA)以及荷兰的 Woo(《开放政府法》),赋予公民直接向政府请求文件的权利。由于这些文件可能包含敏感信息,如个人隐私或对国家安全的威胁,法律允许政府在发布前遮蔽文件的敏感部分。我们基于先前研究,使用大型语言模型(LLM)对 FOIA 豁免 5 中的审议过程特权进行自动敏感度分类。然而,通过第三方云 API 处理尚未通过审查的文件在法律或政治上通常是不可行的。因此,在本工作中,我们使用一个小型本地模型(Qwen3.5 9B)进行敏感度分类,该模型可部署在消费级硬件上。我们比较了应用 LLM 进行句子分类的八种变体,使用了众所周知的提示技术,并发现结合思维链提示和带有基于错误样本的少样本提示在召回率和 F2 分数上优于早期工作的分类模型。该方法也接近一种广泛使用的、高性价比商业模型(Gemini 2.5 Flash)的性能。在额外的分析中,我们发现被预测为审议性的句子包含更多表示表达观点的动词,且更常以第一人称表述。最重要的是,审议性似乎以多种指标的组合存在为特征,特别是第一人称词与表达观点的动词的组合。

关键词

引用

@article{arxiv.2605.10211,
  title  = {To Redact, or not to Redact? A Local LLM Approach to Deliberative Process Privilege Classification},
  author = {Maik Larooij and David Graus},
  journal= {arXiv preprint arXiv:2605.10211},
  year   = {2026}
}

备注

Accepted to The First Workshop on Artificial Intelligence & Open Government at the 21st International Conference on Artificial Intelligence and Law (ICAIL), June 8, 2026, Singapore