中文

双重自蒸馈:LLM 中的情境完整性互补自蒸馈

机器学习 2026-05-21 v1 人工智能 密码学与安全

摘要

情境完整性 (CI) 将隐私定义为根据给定情境规范来治理信息流动,而不仅仅是保持信息隐藏。随着大型语言模型日益被部署作为处理敏感工作流程的个人代理,遵循 CI 变得至关重要。然而,即便是前沿模型在做出披露决策方面仍不可靠,现有缓解策略也常常会损害底层任务性能。为克服隐私-效用之间的权衡,我们提出 SELFCI,即一种互补自蒸馈框架,用于解耦信息抑制与任务解决。SELFCI 联合优化两个独立的 reverse KL 发散,基于来自反馈的两个不同教师分布:一个鼓励保留任务相关信息以实现效用,另一个则强制执行最小且恰当的披露。这种互补表格导致一种 Product-of-Experts (PoE) 目标,将策略与能力与隐私要求的交集相吻合。经验评估表明,SELFCI 无需依赖高成本的外部监督,即可持续地超过诸如在线强化学习算法(如 GRPO)等竞争性基线。这些趋势进一步延伸到涉及 agentic 工作流程和累积私有情境的跨域设置中,表明 SELFCI 为 CI 对齐提供了一条实用的路径。

关键词

引用

@article{arxiv.2605.20258,
  title  = {It Takes Two: Complementary Self-Distillation for Contextual Integrity in LLMs},
  author = {Sangwoo Park and Woongyeong Yeo and Seanie Lee and Yumin Choi and Hyomin Lee and Kangsan Kim and Jinheon Baek and Seong Joon Oh and Sung Ju Hwang},
  journal= {arXiv preprint arXiv:2605.20258},
  year   = {2026}
}

备注

28 pages, 16 figures