中文

通过推理与强化学习实现LLM中的上下文完整性

人工智能 2026-01-01 v4 计算与语言 机器学习

摘要

随着自主代理代表用户做出决策的时代展开,确保上下文完整性——即在执行特定任务时分享适当信息——成为该领域的核心问题。我们认为,上下文完整性需要一种推理形式,即代理需要对其所运行的上下文进行推理。为了验证这一点,我们首先提示LLM在决定披露哪些信息时明确推理上下文完整性。然后,我们通过开发一个强化学习框架来扩展这种方法,该框架进一步向模型灌输实现上下文完整性所需的推理。使用一个仅包含约700个样本但具有多样化上下文和信息披露规范的人工自动创建数据集,我们表明我们的方法在保持多个模型大小和族别的任务性能的同时,大幅减少了不当的信息披露。重要的是,改进从该合成数据集转移到了已建立的上下文完整性基准测试,如PrivacyLens,该基准测试具有人工标注并评估AI助手在动作和工具调用中的隐私泄露。我们的代码可在以下网址获取:https://github.com/EricGLan/CI-RL

关键词

引用

@article{arxiv.2506.04245,
  title  = {Contextual Integrity in LLMs via Reasoning and Reinforcement Learning},
  author = {Guangchen Lan and Huseyin A. Inan and Sahar Abdelnabi and Janardhan Kulkarni and Lukas Wutschitz and Reza Shokri and Christopher G. Brinton and Robert Sim},
  journal= {arXiv preprint arXiv:2506.04245},
  year   = {2026}
}

备注

39th Conference on Neural Information Processing Systems (NeurIPS 2025)