面向更安全生成式 AI 的共识抽样
人工智能
2026-05-12 v2 机器学习
摘要
受到不可检测生成式 AI 风险的启发,我们研究了如何聚合多个概率分布以提升安全性的通用鲁棒聚合问题。我们提出了共识抽样(consensus sampling)方法,这是一种黑箱算法,给定 k 个分布,风险与其中最安全的 s 个的平均风险相当,同时在不足够一致时进行中止。这yield(导致)了一种无需模型架构约束的方法,用于生成模型安全,当这些分布由能够采样和评估输出概率的模型产生时。我们通过 R-robustness(R 鲁棒性)形式化了该保证,这还界限了信息泄露和对抗性影响。灵感来自鲁棒统计学和 Vyas 等人(2023)中可证明的版权保护算法,我们展示了虽然标准混合模型对一个不安全组成部分易受攻击,点wise-中位数构建提供了鲁棒直觉,且我们的高效抽样器在最坏情况风险与中止率之间的权衡中是帕累托最优的。针对合成分布和图像生成的实验说明了通用机制及其激励的安全应用。该方法需要安全分布之间存在重叠,但它提供了一种无模型约束的方式,从未知可靠子集继承保证。
引用
@article{arxiv.2511.09493,
title = {Consensus Sampling for Safer Generative AI},
author = {Adam Tauman Kalai and Yael Tauman Kalai and Or Zamir},
journal= {arXiv preprint arXiv:2511.09493},
year = {2026}
}