拥抱歧义:贝叶斯非参数与利益相关者参与用于模糊安全评估
人工智能
2026-01-23 v2 应用统计
摘要
生成式 AI 模型的评估往往将细微行为坍缩为为单个解码配置计算的单一数值。此类点估计掩盖了尾部风险、人口学差异以及多个近最优运行点的存在。我们提出了一个统一框架,通过建模解码旋钮和提示词空间中有害行为的分布,借助以尾部为焦点的度量标准量化风险,并整合利益相关者偏好。我们的技术贡献有三方面:(i)我们形式化解码拉斯赫蒙集合,即在给定准则下其风险近似最优的旋钮空间区域,并衡量其规模和不一致性;(ii)我们发展一种依赖性狄利克雷过程(DDP)混合模型,其利益相关者条件化的棒棒糖权重用于学习多模态伤害表面;(iii)我们引入一个主动抽样管道,使用贝叶斯深度学习代理高效探索旋钮空间。我们的ethods 连接了奇点理论、贝叶斯非参数方法与利益相关者对齐的灵敏度分析,为可信赖的生成模型部署铺平了道路。
引用
@article{arxiv.2504.15211,
title = {Embracing Ambiguity: Bayesian Nonparametrics and Stakeholder Participation for Ambiguity-Aware Safety Evaluation},
author = {Yanan Long},
journal= {arXiv preprint arXiv:2504.15211},
year = {2026}
}
备注
AAAI 2026 workshop MURE