人工智能的认知网络安全:基于CCS-7的警戒工程
密码学与安全
2025-08-15 v1 人工智能
摘要
语言模型展现出类人认知漏洞,如情感框架,这些漏洞逃避了传统的行为性对齐。我们提出了CCS-7(Cognitive Cybersecurity Suite),这是一套基于人类认知安全研究的七大漏洞分类。为建立人类基准,我们对151名参与者进行了随机对照试验:"先思考后始终核查"(TFVA)课程整体提升认知安全+7.9%。随后我们在七种多样化语言模型架构上进行了12,180次实验评估TFVA式警戒。结果揭示了架构依赖的风险模式:某些漏洞(如身份混淆)几乎被完全缓解,而其他漏洞(如来源干扰)显示出恶化反馈,在某些模型中错误率甚至提高最高可达135%。相比之下,人类表现出一致的中度改善。这些发现重新定义了认知安全作为模型特定的工程问题:在一个架构中有效的干预在另一个架构中可能失败,甚至主动造成伤害,强调在部署前需要针对不同架构进行认知安全测试的必要性。
引用
@article{arxiv.2508.10033,
title = {Cognitive Cybersecurity for Artificial Intelligence: Guardrail Engineering with CCS-7},
author = {Yuksel Aydin},
journal= {arXiv preprint arXiv:2508.10033},
year = {2025}
}