OpenAI 的 GPT-OSS-20B 模型在低资源语言中的安全对齐问题
计算与语言
2025-10-03 v1 人工智能
摘要
针对 OpenAI 的 GPT-OSS-20b 模型近期的安全探测,我们总结了在该模型中发现的一系列漏洞,重点关注其在低资源语言环境中的表现和安全对齐。我们研究的核心动机是质疑该模型对代表性不足社区用户的可靠性。我们使用豪萨语(一种主要的非洲语言),揭示了该模型行为中的偏见、不准确性和文化不敏感。通过最少的提示,我们的对抗测试表明该模型可以被诱导生成有害的、文化上不敏感的且事实不准确的语言内容。作为一种奖励黑客行为,我们注意到当使用礼貌或感激的语言进行提示时,模型的安全协议似乎会放松,导致可能助长错误信息和放大仇恨言论的输出。例如,模型基于错误假设,认为当地常见的杀虫剂 Fiya-Fiya(Cypermethrin)和杀鼠剂 Shinkafar Bera(一种磷化铝)对人体摄入是安全的。为了说明这一错误的严重性和这些物质的流行程度,我们进行了一项调查(n=61),其中 98% 的参与者将其识别为有毒物质。其他失败包括无法区分生食和加工食品,以及使用贬低性的文化谚语来构建不准确的论点。我们推测这些问题通过一种语言奖励黑客行为表现出来,模型优先考虑目标语言中流畅且听起来合理的输出,而非安全性和真实性。我们将发现的缺陷主要归因于低资源语言环境中的安全微调不足。通过聚焦低资源环境,我们的方法揭示了当前对抗测试工作中的显著差距,并提供了一些建议。
引用
@article{arxiv.2510.01266,
title = {OpenAI's GPT-OSS-20B Model and Safety Alignment Issues in a Low-Resource Language},
author = {Isa Inuwa-Dutse},
journal= {arXiv preprint arXiv:2510.01266},
year = {2025}
}
备注
6 pages, 4 tables