通过规范性模拟体强化 LLM 中的隐私推理
机器学习
2026-04-24 v1 人工智能
摘要
LLM 代理的信息处理实践广泛与用户的情境相关隐私期望不一致。情境完整性(Contextual Integrity, CI)提供了一套原则框架,定义隐私为在情境相对规范内信息appropriate flow。然而,现有方法要么通过监督-助手架构增加推理成本,要么在狭窄任务特定数据上进行微调。我们提出从小说中提取规范性模拟体(normative simulacra,即规范和信息流的结构化表示),并通过监督学习随后使用 GRPO 强化学习对 LLM 进行微调。我们的组合奖励函数结合了程序化信号,包括任务清晰度(涵盖模式有效性、构造区分度和提取置信度)、结构完整性、内部一致性和情境识别,以及一个 LLM 评判器,用于评估模型的隐私推理是否基于源文本中 held-out 规范性宇宙。为缓解过拟合,我们引入每个完成项的对比评分:每个完成项都针对正确的规范性宇宙和随机选取的错误宇宙进行评估,教会模型根据情境而非记忆源特定规范进行条件化。我们在五个覆盖不同社会情境的 CI 对齐基准上进行评估,并对 RL 和规范性 grounding 的贡献进行消融分析。对于七个模型,SFT 引入了一种保守的先验,限制信息流,改善了隐私相关情境的识别,但未提高隐私判断的正确性。带有规范性 grounding 的 GRPO 在法律合规基准上取得最高分,并显示出与众所周知的人类隐私期望之间的最强相关性,表明小说派生的规范性模拟体可以教会 LLM 进行情境隐私推理,并在现实领域中实现迁移。
引用
@article{arxiv.2604.20904,
title = {Reinforcing privacy reasoning in LLMs via normative simulacra from fiction},
author = {Matt Franchi and Madiha Zahrah Choksi and Harold Triedman and Helen Nissenbaum},
journal= {arXiv preprint arXiv:2604.20904},
year = {2026}
}