LiSA:基于保守策略诱导的终身安全适应
机器学习
2026-05-15 v1 计算与语言
密码学与安全
摘要
随着AI代理从聊天界面转向读取私人数据、调用工具并执行多步工作流的系统,护栏成为抵御具体部署危害的最后一道防线。在这些场景中,护栏失效不再仅仅是答案质量错误:它们可能泄露机密、授权不安全操作或阻碍合法工作。最困难的失效往往是上下文相关的:操作是否可接受取决于难以在部署前指定的本地隐私规范、组织策略和用户期望。这造成了实际差距:护栏必须适应其自身运行环境,但部署反馈通常仅限于稀疏、嘈杂的用户报告失效,且反复微调往往不切实际。为弥补此差距,我们提出LiSA(终身安全适应),一种通过结构化记忆改进固定基础护栏的保守策略诱导框架。LiSA将偶发失效转化为可复用的策略抽象,使稀疏报告能超越个别案例泛化;添加冲突感知的局部规则以防止在混合标签上下文中的过度泛化;并通过后验下界应用证据感知的置信度门控,使记忆复用随积累证据而非仅凭经验准确率扩展。在PrivacyLens+、ConFaide+和AgentHarm上,LiSA在稀疏反馈下持续优于基于记忆的强基线,即使在20%标签翻转率的嘈杂用户反馈下仍保持鲁棒,并将延迟-性能前沿推至骨干模型缩放之外。最终,LiSA提供了一条实用路径,以保护AI代理免受现实世界边缘风险不可预测的长尾影响。
引用
@article{arxiv.2605.14454,
title = {LiSA: Lifelong Safety Adaptation via Conservative Policy Induction},
author = {Minbeom Kim and Lesly Miculicich and Bhavana Dalvi Mishra and Mihir Parmar and Phillip Wallis and Bharath Chandrasekhar and Kyomin Jung and Tomas Pfister and Long T. Le},
journal= {arXiv preprint arXiv:2605.14454},
year = {2026}
}
备注
27 pages, 3 figures