中文

Oyster-I:超越拒绝——面向负责任语言模型的建设性安全对齐

人工智能 2025-10-15 v7 计算与语言 计算机与社会 人机交互 符号计算

摘要

大型语言模型(LLM)通常部署安全机制以防止生成有害内容。当前大多数方法狭隘地关注恶意行为者带来的风险,通常将风险视为对抗性事件并依赖防御性拒绝。然而,在现实环境中,风险也来自寻求帮助但处于心理困境(例如自残意图)的非恶意用户。在这种情况下,模型的响应会强烈影响用户的下一步行动。简单的拒绝可能导致他们重复、升级或转向不安全的平台,造成更糟的后果。我们引入了建设性安全对齐(CSA),这是一种以人为中心的范式,既能防范恶意滥用,又能主动引导脆弱用户走向安全且有益的结果。在Oyster-I(Oy1)中实现的CSA结合了对用户反应的博弈论预测、细粒度的风险边界发现以及可解释的推理控制,将安全转化为建立信任的过程。Oy1在开源模型中实现了SOTA安全水平,同时保持了高通用能力。在我们的建设性基准上,它展现出强大的建设性互动能力,接近GPT-5,并在Strata-Sword越狱数据集上表现出无与伦比的鲁棒性,接近GPT-o1水平。通过从“拒绝优先”转向“引导优先”的安全策略,CSA重新定义了模型与用户的关系,旨在构建不仅安全而且真正有帮助的系统。我们发布了Oy1、代码和基准,以支持负责任、以用户为中心的AI。

关键词

引用

@article{arxiv.2509.01909,
  title  = {Oyster-I: Beyond Refusal -- Constructive Safety Alignment for Responsible Language Models},
  author = {Ranjie Duan and Jiexi Liu and Xiaojun Jia and Shiji Zhao and Ruoxi Cheng and Fengxiang Wang and Cheng Wei and Yong Xie and Chang Liu and Defeng Li and Yinpeng Dong and Yichi Zhang and Yuefeng Chen and Chongwen Wang and Xingjun Ma and Xingxing Wei and Yang Liu and Hang Su and Jun Zhu and Xinfeng Li and Yitong Sun and Jie Zhang and Jinzhao Hu and Sha Xu and Wenchao Yang and Yitong Yang and Xingyao Zhang and Yingshui Tan and Jialing Tao and Hui Xue},
  journal= {arXiv preprint arXiv:2509.01909},
  year   = {2025}
}

备注

Technical Report Code & Model weights available: https://github.com/Alibaba-AAIG/Oyster