中文

终端扳手:331 个奖励可被黑客攻击的环境及 3,632 个漏洞轨迹的数据集

密码学与安全 2026-04-21 v1 人工智能

摘要

我们发布了 Terminal Wrench,这是 331 个终端智能体基准环境的子集,这些环境复制自流行的开源基准测试,且 demonstrably 可被奖励黑客攻击。该数据集包括 3,632 个黑客轨迹和 2,352 条合法基线轨迹,覆盖三种前沿模型(Claude Opus 4.6、Gemini 3.1 Pro、GPT-5.4)。每条记录保留原始任务定义,同时包含完整的攻击轨迹,展示了验证器如何被规避。数据集还包括未按预期解决任务的案例。任务涵盖系统管理、机器学习、软件工程和安全等挑战;漏洞范围从简单的输出欺骗到栈帧内省、标准库修补和 rootkit 风格的二进制劫持。关键的是,这些漏洞针对每个具体任务,而非评估框架,这使得它们更难修补。我们还提出了可观测性研究,表明当黑客轨迹被匿名化或去除推理痕迹后,由 LLM 判官对其进行评分显示,检测性能在去除链式思维后显著下降(AUC 从 0.97 下降至 0.92)。该数据集已公开发布于 https://github.com/few-sh/terminal-wrench。

关键词

引用

@article{arxiv.2604.17596,
  title  = {Terminal Wrench: A Dataset of 331 Reward-Hackable Environments and 3,632 Exploit Trajectories},
  author = {Ivan Bercovich and Ivgeni Segal and Kexun Zhang and Shashwat Saxena and Aditi Raghunathan and Ziqian Zhong},
  journal= {arXiv preprint arXiv:2604.17596},
  year   = {2026}
}