从硬拒绝到安全补全:走向以输出为中心的安全训练
计算机与社会
2025-08-14 v1 人工智能
计算与语言
摘要
用于ChatGPT的大语言模型传统上被训练来学习一个拒绝边界:根据用户的意图,模型被教导要么完全服从,要么直接拒绝。虽然这对于明确恶意的提示词是一种强有力的缓解措施,但将安全训练集中在拒绝上可能会导致对意图模糊的提示词的脆弱性。二元拒绝边界特别不适合双重用途情况(如生物学或网络安全),在这些情况下,可以在高层次上安全地回答用户请求,但在某些情况下,如果足够详细或具有可操作性,可能会导致恶意助长。作为替代,我们提出了安全补全:一种以助手输出的安全性为中心的安全训练方法,而不是对用户意图的二元分类。安全补全试图在安全策略的约束内最大化帮助性。我们将这种方法整合到GPT-5中,并发现在生产比较和内部对照实验中,安全补全训练提高了安全性(特别是在双重用途提示词上),降低了残余安全故障的严重性,并显著提高了模型的帮助性。
引用
@article{arxiv.2508.09224,
title = {From Hard Refusals to Safe-Completions: Toward Output-Centric Safety Training},
author = {Yuan Yuan and Tina Sriskandarajah and Anna-Luisa Brakman and Alec Helyar and Alex Beutel and Andrea Vallone and Saachi Jain},
journal= {arXiv preprint arXiv:2508.09224},
year = {2025}
}