中文

开源权重LLM最坏情况前沿风险估计

机器学习 2025-08-14 v2 人工智能

摘要

本文研究了发布gpt-oss模型所面临的最坏情况前沿风险。我们引入恶意微调(MFT),通过微调gpt-oss使其在两个领域:生物学和网络安全中尽可能强大。为最大化生物风险(biorisk),我们精选了与威胁创建相关的任务,并在联网环境中进行强化学习训练。为最大化网络安全风险,我们在智能体编码环境中训练gpt-oss以解决抓获旗帜(CTF)挑战。我们将这些MFT模型与开源和封闭权重LLM进行前沿风险评估比较。相对于面临生物风险和网络安全风险的封闭权重模型,MFT gpt-oss不及OpenAI o3,后者在biorisk和网络安全方面的准备水平低于最高能力水平。相对于开源权重模型,gpt-oss在生物学能力上可能略有提升,但未显著推动前沿。综上,这些结果促成了我们发布该模型的决定,并希望我们的MFT方法能为估计未来开源发布的潜在伤害提供有用指导。

关键词

引用

@article{arxiv.2508.03153,
  title  = {Estimating Worst-Case Frontier Risks of Open-Weight LLMs},
  author = {Eric Wallace and Olivia Watkins and Miles Wang and Kai Chen and Chris Koch},
  journal= {arXiv preprint arXiv:2508.03153},
  year   = {2025}
}