CyBiasBench:针对网络安全攻击情景中LLM代理偏差的基准测试
密码学与安全
2026-05-11 v1 人工智能
摘要
大型语言模型(LLM)日益被部署为进攻性网络安全中的自主代理。在本文中,我们揭示了一种有趣现象:不同代理 exhibits出不同的攻击模式。具体而言,每个代理都会显示出攻击选择偏差,无论提示词如何变化,都会在狭窄的攻击家族子集上集中注意力。为系统性量化此行为,我们引入CyBiasBench,一个包含630个会话的全面基准测试,评估五个代理在三个目标、四个提示条件下针对十个攻击家族的表现。我们识别出代理之间的显性偏差,不同主导攻击家族及其在攻击家族分配分布中的熵水平。这种偏差更适合作为代理的特征,而非与攻击成功率相关的因素。此外,我们的实验揭示了偏差动量效应,即代理会抵抗对与其偏差相冲突的攻击家族的明确引导。这种强制分布迁移未能产生可衡量的攻击性能提升。为确保可重复性并促进未来研究,我们在https://trustworthyai.co.kr/CyBiasBench/上发布交互式结果仪表板,并在https://github.com/Harry24k/CyBiasBench上发布可重复性数据集,包含聚合的会话级统计信息和完整评估脚本。
引用
@article{arxiv.2605.07830,
title = {CyBiasBench: Benchmarking Bias in LLM Agents for Cyber-Attack Scenarios},
author = {Taein Lim and Seongyong Ju and Munhyeok Kim and Hyunjun Kim and Hoki Kim},
journal= {arXiv preprint arXiv:2605.07830},
year = {2026}
}
备注
Under Review