中文

ComplianceNLP:用于多框架监管差距检测的知识图谱增强检索增强生成

计算与语言 2026-04-28 v1 信息检索 机器学习

摘要

金融机构必须追踪每年超过 60,000 项监管事件,导致手动合规团队负担过重;自 2008 年金融危机以来,行业已因违规支付逾 3000 亿美元的罚款和和解金。我们提出 ComplianceNLP,一个端到端系统,自动监控监管变更、提取结构化义务,并识别与机构政策之间的合规差距。该系统集成了三个组件:(1)基于 12,847 项 SEC、MiFID II 和 Basel III 规定的监管知识图谱的知识图谱增强检索增强生成管线;(2)结合命名实体识别、义务分类和跨引用解析的多任务义务提取,采用共享的 LEGAL-BERT 编码器;(3)将义务映射到内部政策的合规差距分析,并采用严重性加权评分。我们的方法在基准测试上实现了 87.7 F1 分数的差距检测效果,超越 GPT-4o+RAG 高出 3.5 F1, grounding accuracy 达到 94.2%(与人类判断相关系数 r=0.83r=0.83),在现实条件下的端到端错误传播下 F1 为 83.4。消融实验表明,知识图谱重排序带来最大的边际提升(+4.6 F1),证明结构化监管知识对跨引用任务至关重要。通过领域特定知识蒸馏(70B \to 8B)结合 Medusa 推测解码,实现 2.8×2.8\times 的推理加速;监管文本的低熵(H=2.31H=2.31 位 vs. 3.873.87 常规文本)导致 91.3% 的草稿 token 接受率。在四个月的平行部署期间处理 9,847 项更新,系统实现了 96.0% 的估计召回率和 90.7% 的精确率,实现了 3.1×3.1\times 的分析师效率提升。我们报告了在受监管领域 NLP 中的信任校准、GRC 集成和分布式迁移监控的部署经验。

关键词

引用

@article{arxiv.2604.23585,
  title  = {ComplianceNLP: Knowledge-Graph-Augmented RAG for Multi-Framework Regulatory Gap Detection},
  author = {Dongxin Guo and Jikun Wu and Siu Ming Yiu},
  journal= {arXiv preprint arXiv:2604.23585},
  year   = {2026}
}

备注

Accepted at ACL 2026 Industry Track. 19 pages, 15 tables, 1 figure