面向开源基础模型安全的 PRISM 设计框架
计算机与社会
2024-06-18 v1 人工智能
软件工程
摘要
开源基础模型的快速发展为该革命性技术带来了透明度和可接入性。然而,这种开放性也使得开发出高度能力且不安全的模型成为可能,正如近期实例如 WormGPT 和 FraudGPT 所示,这些模型专为 facilitate 犯罪活动而设计。随着开源基础模型能力的持续增长,potentially 超越封闭源模型,恶意行为者对社会的滥用风险日益严重。本文解决开源基础模型开发者应如何在面对这些挑战时 approach model safety 的关键问题。我们的分析表明,开源基础模型公司通常提供的可接受用途政策(AUPs)比其封闭源模型 counterpart 限制更少,likely 由于模型一旦发布后对此类政策的执行存在固有的困难。为此,我们提出 PRISM,一个面向开源基础模型 safety 的 design framework,强调 Private, Robust, Independent Safety measures, at Minimal marginal cost of compute。PRISM 框架提议使用模块化函数来 moderate 提示和输出,独立于 core language model,提供比当前用于 value alignment 的脆弱强化学习方法更具可适应性和韧性。通过关注识别 AUP 违规并 engage the developer community in establishing consensus around safety design decisions, PRISM 旨在创建一个更安全的开源生态系统,在最大化这些强大技术的潜能的同时,最小化对 individuals 和 society 整体的风险。
引用
@article{arxiv.2406.10415,
title = {PRISM: A Design Framework for Open-Source Foundation Model Safety},
author = {Terrence Neumann and Bryan Jones},
journal= {arXiv preprint arXiv:2406.10415},
year = {2024}
}