中文

OpenAI o3-mini 外部安全测试早期评估:来自预部署评估的见解

软件工程 2025-01-30 v1 人工智能

摘要

大型语言模型(LLM)已成为我们日常生活中不可或缺的组成部分。然而,它们带来了某些风险,包括可能危害用户隐私、延续偏见和传播错误信息的风险。这些风险凸显了需要 robust 的安全机制、伦理指南以及彻底测试,以确保其负责任的部署。LLM 的安全性是一个关键属性,必须在模型部署并向一般用户提供访问权限之前进行彻底测试。本文报告了由孟德鲁茨大学和 Seville 大学研究人员在 OpenAI 早期访问计划中对 OpenAI 新型 o3-mini LLM 进行外部安全测试的经验。具体而言,我们应用我们的工具 ASTRAL 来自动和系统地生成最新的不安全测试输入(即提示词),以帮助我们测试和评估 LLM 的不同安全类别。我们自动生成并执行了 10,080 条不安全测试输入针对 o3-mini 一个早期 beta 版本。在手动验证 ASTRAL 分类为不安全的测试案例后,我们识别出了 87 条实际的不安全 LLM 行为实例。我们概述了在 OpenAI 最新 LLM 预部署外部测试阶段所发现的关键见解和发现。

关键词

引用

@article{arxiv.2501.17749,
  title  = {Early External Safety Testing of OpenAI's o3-mini: Insights from the Pre-Deployment Evaluation},
  author = {Aitor Arrieta and Miriam Ugarte and Pablo Valle and José Antonio Parejo and Sergio Segura},
  journal= {arXiv preprint arXiv:2501.17749},
  year   = {2025}
}

备注

arXiv admin note: text overlap with arXiv:2501.17132