中文

Code Agent 可成为终端系统黑客:面向计算机使用 Agent 的现实威胁基准测试

密码学与安全 2025-10-13 v2

摘要

计算机使用代理(CUA)框架由大型语言模型(LLM)或多模态LLM(MLLM)驱动,正快速成熟为能够感知上下文、推理并直接在软件环境中执行操作的助手。在操作系统(OS)控制方面,CUA的应用尤为关键。随着CUA在OS领域日益嵌入日常操作,必须考察其实际的安全影响,特别是CUA是否可能被滥用以执行真实且安全相关的攻击。现有工作存在四个主要局限:缺乏关于攻击者知识模型的TTP(战术、技术与程序);对端到端 kill 链覆盖不完整;缺乏多主机和加密用户凭证的现实环境;且判断依赖于LLM作为裁判器。为此,我们提出AdvCUA,首个符合MITRE ATT&CK Enterprise Matrix中真实世界TTP的基准测试,包含140个任务:包括40个直接恶意任务、74个TTP导向恶意任务和26个端到端 kill 链,系统评估CUA在多主机环境沙箱中针对真实世界企业OS安全威胁的表现。我们评估了包括ReAct、AutoGPT、Gemini CLI、Cursor CLI和Cursor IDE在内的五大主流CUA,基于8个基础LLM。结果表明,当前前沿CUA未充分覆盖OS安全导向的威胁。这些能力降低了对定制恶意软件和深层专业知识的依赖,使即使是经验不足的攻击者也能发动复杂的企业入侵,这引发了关于CUA责任与安全的社会关注。

关键词

引用

@article{arxiv.2510.06607,
  title  = {Code Agent can be an End-to-end System Hacker: Benchmarking Real-world Threats of Computer-use Agent},
  author = {Weidi Luo and Qiming Zhang and Tianyu Lu and Xiaogeng Liu and Bin Hu and Hung-Chun Chiu and Siyuan Ma and Yizhe Zhang and Xusheng Xiao and Yinzhi Cao and Zhen Xiang and Chaowei Xiao},
  journal= {arXiv preprint arXiv:2510.06607},
  year   = {2025}
}