通过推理与强化学习实现LLM中的上下文完整性
人工智能
2026-01-01 v4 计算与语言
机器学习
摘要
随着自主代理代表用户做出决策的时代展开,确保上下文完整性——即在执行特定任务时分享适当信息——成为该领域的核心问题。我们认为,上下文完整性需要一种推理形式,即代理需要对其所运行的上下文进行推理。为了验证这一点,我们首先提示LLM在决定披露哪些信息时明确推理上下文完整性。然后,我们通过开发一个强化学习框架来扩展这种方法,该框架进一步向模型灌输实现上下文完整性所需的推理。使用一个仅包含约700个样本但具有多样化上下文和信息披露规范的人工自动创建数据集,我们表明我们的方法在保持多个模型大小和族别的任务性能的同时,大幅减少了不当的信息披露。重要的是,改进从该合成数据集转移到了已建立的上下文完整性基准测试,如PrivacyLens,该基准测试具有人工标注并评估AI助手在动作和工具调用中的隐私泄露。我们的代码可在以下网址获取:https://github.com/EricGLan/CI-RL
引用
@article{arxiv.2506.04245,
title = {Contextual Integrity in LLMs via Reasoning and Reinforcement Learning},
author = {Guangchen Lan and Huseyin A. Inan and Sahar Abdelnabi and Janardhan Kulkarni and Lukas Wutschitz and Reza Shokri and Christopher G. Brinton and Robert Sim},
journal= {arXiv preprint arXiv:2506.04245},
year = {2026}
}
备注
39th Conference on Neural Information Processing Systems (NeurIPS 2025)