确定性模糊分流:法律合规分类与证据检索
机器学习
2026-03-10 v1
摘要
法律团队越来越多地使用机器学习来分流大量合同证据,但许多模型是不可靠的、非确定性的,且难以与 HIPAA 或 NERC-CIP 等框架对齐。我们研究了一个简单、可重复的替代方案,基于确定性双编码器和透明的模糊分流带。我们使用 512 维投影和余弦相似度在 ACORD 榜基上训练 RoBERTa-base 双编码器,以进行分级子句检索,然后在基于 CUAD 的二分类合规数据集上进行微调。在单个 NVIDIA A100 GPU 上,使用 5 个随机种子(40-44),该模型在 ACORD 风格的检索性能方面实现了 NDCG@5 0.38-0.42、NDCG@10 0.45-0.50,以及约 0.37 的 4 星 Precision@5;在 CUAD 派生的二分类标签上实现了 AUC 0.98-0.99 和 F1 0.22-0.30,具体取决于正类权重。我们将标量合规分数映射到三个区域:自动不合规、自动合规和人工审核。在验证数据上调整阈值,以在自动决定的示例中实现最多 2% 的经验错误率约束的同时最大化自动决策覆盖率。结果是一个基于少数标量参数的稳定系统。我们认为确定性编码器、校准的模糊带和显式的错误约束为在手工规则和不透明的大型语言模型之间提供了一个实用的折中方案,支持可解释的证据分流、可重复的审计轨迹以及对法律审查概念的具体映射。
引用
@article{arxiv.2603.07390,
title = {Deterministic Fuzzy Triage for Legal Compliance Classification and Evidence Retrieval},
author = {Rian Atri},
journal= {arXiv preprint arXiv:2603.07390},
year = {2026}
}
备注
8 pages, 5 figures. Published in the Proceedings of the AAAI Bridge between Artificial Intelligence and Law 2026 (Full papers), pages 51-58