中文

探索 GPT-OSS-20B: 量化发热、推理黑洞、薛定谔合规及其他现象

人工智能 2025-10-07 v2 密码学与安全

摘要

OpenAI的GPT-OSS系列提供具有显式链路思考(CoT)推理和和谐提示格式的开放权重语言模型。本文总结了对GPT-OSS-20B进行广泛安全评估的工作,通过不同的对抗条件探测模型行为。使用Jailbreak Oracle(JO)[1],一款系统化的LLM评估工具,该研究揭示了包括量化发热、推理黑洞、薛定谔合规、推理程序幻象和链式引导等多种失效模式。实验表明,这些行为可在GPT-OSS-20B模型上被利用,导致严重后果。

关键词

引用

@article{arxiv.2509.23882,
  title  = {Quant Fever, Reasoning Blackholes, Schrodinger's Compliance, and More: Probing GPT-OSS-20B},
  author = {Shuyi Lin and Tian Lu and Zikai Wang and Bo Wen and Yibo Zhao and Cheng Tan},
  journal= {arXiv preprint arXiv:2509.23882},
  year   = {2025}
}