QSAF:一种针对自主AI系统认知退化的新型缓解框架
人工智能
2025-07-22 v1
摘要
我们提出将认知退化作为自主AI系统中的一个新型漏洞类别。与传统的对抗性外部威胁(如提示注入)不同,这些故障源自系统内部,由内存饥饿、规划器递归、上下文泛滥和输出抑制引起。这些系统性弱点会导致静默的智能体漂移、逻辑崩溃以及随时间推移的持续性幻觉。为了解决这类故障,我们提出了用于行为与认知韧性的Qorvex安全AI框架(QSAF领域10),这是一个由六阶段认知退化生命周期定义的、生命周期感知的防御框架。该框架包含七个运行时控制机制(QSAF-BC-001至BC-007),可实时监控智能体子系统,并通过回退路由、饥饿检测和内存完整性强制实施来触发主动缓解。借鉴认知神经科学,我们将自主架构映射到人类类似物,从而能够早期检测疲劳、饥饿和角色崩溃。通过引入一个正式的生命周期和实时缓解控制,这项工作将认知退化确立为一类关键的新型AI系统漏洞,并提出了首个用于韧性自主行为的跨平台防御模型。
引用
@article{arxiv.2507.15330,
title = {QSAF: A Novel Mitigation Framework for Cognitive Degradation in Agentic AI},
author = {Hammad Atta and Muhammad Zeeshan Baig and Yasir Mehmood and Nadeem Shahzad and Ken Huang and Muhammad Aziz Ul Haq and Muhammad Awais and Kamal Ahmed},
journal= {arXiv preprint arXiv:2507.15330},
year = {2025}
}