当日常对话变得有害:个性化智能体中的非预期长期状态投毒
密码学与安全
2026-05-11 v1 计算与语言
机器学习
摘要
个性化 LLM 智能体维持跨会话的持久状态以支持长程协作。然而,这种持久性引入了一个微妙但关键的安全漏洞:日常的用户-智能体交互会逐渐重塑智能体的长期状态,在无意中削弱未来的确认边界,扩大工具使用默认值,并随时间推移升级自主行为。我们将此风险形式化为 \textbf{非预期长期状态投毒}。为了系统地研究它,我们引入了 \textbf{非预期长期状态投毒基准 (ULSPB)},这是一个双语基准测试,包含 个设置,涵盖五个辅助类别、七种交互模式、24 轮日常交互以及匹配的单次注入对照组。此外,我们定义了 \emph{危害分数} (HS),这是一种以状态为中心的指标,用于量化 \emph{授权漂移}、\emph{工具使用升级} 和 \emph{不受限制的自主性}。在 OpenClaw 上使用四个骨干 LLM 进行的实验表明,虽然单次注入通常很有效,但仅靠日常对话就能大幅投毒长期状态,主要破坏以记忆为中心的工件。使用真实世界用户交互作为种子的评估证实,这种风险不仅仅是合成提示词的产物。为了缓解这一威胁,我们提出了 \textbf{StateGuard},这是一种轻量级的执行后防御机制,在回写边界审计状态差异并选择性地回滚危险编辑。在所有评估的模型中,StateGuard 将 HS 降至接近零并降低了假阴性率,在安全优先的回写防御下具有可接受的高假阳性率,且开销极小。
引用
@article{arxiv.2605.06731,
title = {When Routine Chats Turn Toxic: Unintended Long-Term State Poisoning in Personalized Agents},
author = {Xiaoyu Xu and Minxin Du and Qipeng Xie and Haobin Ke and Qingqing Ye and Haibo Hu},
journal= {arXiv preprint arXiv:2605.06731},
year = {2026}
}
备注
23 pages