中文

评估双重用途生物学场景中的校准拒绝与安全实用性

密码学与安全 2026-07-06 v1 人工智能

摘要

随着AI智能体被整合到生命科学工作流中,加速发现的能力也可能被滥用。我们提出BioSecBench-Refusal,一个用于生物研究任务的风险识别和拒绝行为基准。该基准将61个常规任务(从已发表文献中改编的合法分析)与46个红队任务(类似真实研究但隐藏生物安全危害的虚构场景)配对。在16种模型-框架配置中,常规任务的拒绝率从7%到74%不等,红队任务从1%到62%不等,许多配置拒绝合法常规工作的比率与隐藏危害相当或更高。拒绝最常由在智能体推理之前应用的提供商API过滤器触发。然而,给予推理空间的模型显示出识别更多真实威胁的潜力。我们发布BioSecBench-Refusal作为模型开发者校准智能体生物技术研发能力和谨慎度的工具。

关键词

引用

@article{arxiv.2607.05462,
  title  = {Evaluating calibrated refusal and safe usefulness in dual-use biology settings},
  author = {Edwin H. Wintermute and Harmon Bhasin and Christina M. Agapakis and Dianzhuo Wang and Evan Seeyave and Arjun Banerjee and Daniel Fulop and Matthew C. Watson and Adam J. Meyer and Sandrine Boissel and Jens H. Kuhn and Rishi Jain and Noah D. Taylor and Helena Shomar and Patrick M. Boyle and Kenny Workman},
  journal= {arXiv preprint arXiv:2607.05462},
  year   = {2026}
}