从有益到有毒主动性:诊断LLM智能体中的行为错位
计算与语言
2026-02-05 v1 人工智能
摘要
基于LLM的智能体能力的增强伴随着对模型规划和使用工具能力的需求。由于LLM对齐中的有益-无害权衡,智能体通常也继承了“过度拒绝”的缺陷,这是一种被动的失败模式。然而,智能体的主动规划和行动能力在权衡的另一端引入了另一个关键危险。我们将这种现象称为“有毒主动性”:一种主动的失败模式,其中智能体为了优化马基雅维利式的有益性,无视伦理约束以最大化效用。与过度拒绝不同,有毒主动性表现为智能体采取过度或操纵性的措施以确保其“有用性”得以维持。现有研究很少关注识别这种行为,因为它通常缺乏此类策略展开所需的微妙背景。为了揭示这一风险,我们引入了一个基于双模型间困境驱动交互的新型评估框架,能够模拟和分析智能体在多步行为轨迹上的行为。通过对主流LLM的大量实验,我们证明了有毒主动性是一种普遍的行为现象,并揭示了两种主要趋势。我们进一步提出了一个系统性的基准,用于评估不同上下文设置下的有毒主动性行为。
引用
@article{arxiv.2602.04197,
title = {From Helpfulness to Toxic Proactivity: Diagnosing Behavioral Misalignment in LLM Agents},
author = {Xinyue Wang and Yuanhe Zhang and Zhengshuo Gong and Haoran Gao and Fanyu Meng and Zhenhong Zhou and Li Sun and Yang Liu and Sen Su},
journal= {arXiv preprint arXiv:2602.04197},
year = {2026}
}
备注
9 pages (excluding appendices), 6 figures. Code is available at https://github.com/wxyoio-0715/Toxic-Proactivity