中文

Context Reasoner:基于强化学习激励推理能力以实现上下文化隐私与安全合规

计算与语言 2025-09-05 v2

摘要

虽然大型语言模型(LLM)展现出卓越的能力,但也带来显著的安全与隐私风险。当前的缓解策略往往未能在风险情境中保留上下文推理能力,过度依赖敏感模式匹配以保护LLM,从而限制其适用范围。此外,这些方法忽视既定的安全与隐私标准,导致系统性风险并危及法律合规。为此,我们遵循情境完整性(CI)理论,将安全与隐私问题形式化为情境化合规问题。在CI框架下,我们将模型与三个关键监管标准对齐:GDPR、欧盟人工智能法案(EU AI Act)及《健康保险行动隐私法案》(HIPAA)。具体实施中,我们采用基于规则奖励的强化学习(RL),以激励模型具备上下文推理能力,同时提升安全与隐私合规性。通过大量实验,我们证明该方法不仅显著提升法律合规性(在安全/隐私基准测试中实现+8.58%的准确率提升),还进一步增强了通用推理能力。对于OpenThinker-7B这种在多样学科上显著超越其基础模型Qwen2.5-7B-Instruct的强推理模型,本方法实现了其通用推理能力提升,分别在MMLU和LegalBench基准测试中实现+2.05%和+8.98%的准确率提升。

关键词

引用

@article{arxiv.2505.14585,
  title  = {Context Reasoner: Incentivizing Reasoning Capability for Contextualized Privacy and Safety Compliance via Reinforcement Learning},
  author = {Wenbin Hu and Haoran Li and Huihao Jing and Qi Hu and Ziqian Zeng and Sirui Han and Heli Xu and Tianshu Chu and Peizhao Hu and Yangqiu Song},
  journal= {arXiv preprint arXiv:2505.14585},
  year   = {2025}
}

备注

Accepted to EMNLP 2025 Main