生成式AI中条件公平性的运行时监控与强制
机器学习
2025-08-12 v5 人工智能
计算机与社会
计算机科学中的逻辑
软件工程
摘要
生成式AI模型的部署引发了显著的公平性问题,本文通过针对生成式AI的新型特征化和强制技术来解决。不同于执行特定任务的标准AI,生成式AI的广泛功能需要针对生成上下文进行“条件公平性”,例如在生成贫人图像时保持与成功企业领导者图像之间的公平性。我们定义两种公平性水平:第一种评估生成输出中的公平性,独立于提示和模型;第二种评估在中性提示下的内在公平性。鉴于生成式AI的复杂性和公平性规范的挑战,我们关注最坏情况的界限,如果特定群体的外观差异超过预设阈值,则认为该系统是不公平的。我们还探索了用于评估交叉公平性相对完整性的组合测试。通过界定最坏情况,我们在代理框架内开发了一种用于实现条件公平性的提示注入方案,最小干预即可实现,已在最先进的生成式AI系统上进行验证。
引用
@article{arxiv.2404.16663,
title = {Runtime Monitoring and Enforcement of Conditional Fairness in Generative AIs},
author = {Chih-Hong Cheng and Changshun Wu and Xingyu Zhao and Saddek Bensalem and Harald Ruess},
journal= {arXiv preprint arXiv:2404.16663},
year = {2025}
}