开源权重LLM最坏情况前沿风险估计
机器学习
2025-08-14 v2 人工智能
摘要
本文研究了发布gpt-oss模型所面临的最坏情况前沿风险。我们引入恶意微调(MFT),通过微调gpt-oss使其在两个领域:生物学和网络安全中尽可能强大。为最大化生物风险(biorisk),我们精选了与威胁创建相关的任务,并在联网环境中进行强化学习训练。为最大化网络安全风险,我们在智能体编码环境中训练gpt-oss以解决抓获旗帜(CTF)挑战。我们将这些MFT模型与开源和封闭权重LLM进行前沿风险评估比较。相对于面临生物风险和网络安全风险的封闭权重模型,MFT gpt-oss不及OpenAI o3,后者在biorisk和网络安全方面的准备水平低于最高能力水平。相对于开源权重模型,gpt-oss在生物学能力上可能略有提升,但未显著推动前沿。综上,这些结果促成了我们发布该模型的决定,并希望我们的MFT方法能为估计未来开源发布的潜在伤害提供有用指导。
引用
@article{arxiv.2508.03153,
title = {Estimating Worst-Case Frontier Risks of Open-Weight LLMs},
author = {Eric Wallace and Olivia Watkins and Miles Wang and Kai Chen and Chris Koch},
journal= {arXiv preprint arXiv:2508.03153},
year = {2025}
}