基于动态认识后备的更安全策略遵循
计算与语言
2026-02-02 v1 机器学习
摘要
人类会发展出一系列认知防御机制,称为认识警觉,以抵御来自日常互动中 deception 和误information 的风险。受此启发开发的 LLM 安全措施,可能对于自动执行数据隐私法律合规性等高风险任务特别有帮助。在本文中,我们引入动态认识后备(Dynamic Epistemic Fallback, DEF),这是一种用于提高 LLM 推理时防御 deception 攻击的动态安全协议,这类攻击利用恶意扰动后的 policy 文本。通过各种层次的单句文本线索,DEF 引导 LLM 对扰动后的 policy 文本进行不一致性标记、拒绝合规,并回退到其参数化知识。使用 HIPAA 和 GDPR 等全球认可的法律 policy,我们的实证评估报告称,DEF 有效提高了主流 LLM 检测和拒绝扰动版 policy 的能力,其中 DeepSeek-R1 在一个设置中实现了 100% 的检测率。这一工作鼓励进一步努力开发受认知启发的防御机制,以提高 LLM 对利用法律文件造成伤害和 deception 的鲁棒性。
引用
@article{arxiv.2601.23094,
title = {Safer Policy Compliance with Dynamic Epistemic Fallback},
author = {Joseph Marvin Imperial and Harish Tayyar Madabushi},
journal= {arXiv preprint arXiv:2601.23094},
year = {2026}
}