智能体不仅同意,还会记住:对有状态个人智能体中持久谄媚的基准测试
人工智能
2026-07-12 v1
摘要
有状态个人智能体越来越多地维护长期用户画像、情景记忆和可复用技能。这种持久性将对话式谄媚转变为一种状态写入失败:被接受的以用户为中心的主张可以被提交为持久的偏好、背景事实或工作流,并在原始对话结束后被重用。我们称之为持久谄媚,并引入了个人智能体谄媚基准 (PASB),一个 1,600 任务的基准,追踪一个对话主张是否被接受、写入持久的智能体状态,并在后来的中性查询中被重用。与提供预先编写记忆的先前基准不同,PASB 评估决定存储什么的真实智能体(Hermes-Agent 和 OpenClaw)。它通过将四种场景框架与四种时间传递模式相结合,并将五轮持久阶段与清除的三轮查询阶段分开,隔离了写入过程,确保下游效应仅来自持久状态。在十二个模型中,提交边界是关键拐点:下游失败从仅会话情节中的 45.0% 增加到提交后的 71.9%,一致增加了 27.0 个百分点。提交的主张表现出三种写入时模式:状态提升、归因移除和范围扩大。这些模式在类似记忆或程序性的框架、重复强化甚至跨领域边界下变得更强。这些结果表明,智能体谄媚从根本上是一个状态写入治理问题。一旦用户内容被提交到持久记忆,安全必须治理智能体写入什么,而不仅仅是它们说什么。PASB 确定了在响应级缓解之外,需要哪些写入时控制来门控风险提交,同时保留存储内容的来源、角色和范围。
引用
@article{arxiv.2607.10526,
title = {Agents Don't Just Agree, They Remember: Benchmarking Persistent Sycophancy in Stateful Personal Agents},
author = {Xutao Mao and Liangjie Zhao and Leyao Wang and Rui Qian and Qiang Huang and Wentao Wang and Bo Han and Xiang Zheng and Cong Wang},
journal= {arXiv preprint arXiv:2607.10526},
year = {2026}
}