中文

当日常对话变得有害:个性化智能体中的非预期长期状态投毒

密码学与安全 2026-05-11 v1 计算与语言 机器学习

摘要

个性化 LLM 智能体维持跨会话的持久状态以支持长程协作。然而,这种持久性引入了一个微妙但关键的安全漏洞:日常的用户-智能体交互会逐渐重塑智能体的长期状态,在无意中削弱未来的确认边界,扩大工具使用默认值,并随时间推移升级自主行为。我们将此风险形式化为 \textbf{非预期长期状态投毒}。为了系统地研究它,我们引入了 \textbf{非预期长期状态投毒基准 (ULSPB)},这是一个双语基准测试,包含 350350 个设置,涵盖五个辅助类别、七种交互模式、24 轮日常交互以及匹配的单次注入对照组。此外,我们定义了 \emph{危害分数} (HS),这是一种以状态为中心的指标,用于量化 \emph{授权漂移}、\emph{工具使用升级} 和 \emph{不受限制的自主性}。在 OpenClaw 上使用四个骨干 LLM 进行的实验表明,虽然单次注入通常很有效,但仅靠日常对话就能大幅投毒长期状态,主要破坏以记忆为中心的工件。使用真实世界用户交互作为种子的评估证实,这种风险不仅仅是合成提示词的产物。为了缓解这一威胁,我们提出了 \textbf{StateGuard},这是一种轻量级的执行后防御机制,在回写边界审计状态差异并选择性地回滚危险编辑。在所有评估的模型中,StateGuard 将 HS 降至接近零并降低了假阴性率,在安全优先的回写防御下具有可接受的高假阳性率,且开销极小。

关键词

引用

@article{arxiv.2605.06731,
  title  = {When Routine Chats Turn Toxic: Unintended Long-Term State Poisoning in Personalized Agents},
  author = {Xiaoyu Xu and Minxin Du and Qipeng Xie and Haobin Ke and Qingqing Ye and Haibo Hu},
  journal= {arXiv preprint arXiv:2605.06731},
  year   = {2026}
}

备注

23 pages