中文

生成式AI中条件公平性的运行时监控与强制

机器学习 2025-08-12 v5 人工智能 计算机与社会 计算机科学中的逻辑 软件工程

摘要

生成式AI模型的部署引发了显著的公平性问题,本文通过针对生成式AI的新型特征化和强制技术来解决。不同于执行特定任务的标准AI,生成式AI的广泛功能需要针对生成上下文进行“条件公平性”,例如在生成贫人图像时保持与成功企业领导者图像之间的公平性。我们定义两种公平性水平:第一种评估生成输出中的公平性,独立于提示和模型;第二种评估在中性提示下的内在公平性。鉴于生成式AI的复杂性和公平性规范的挑战,我们关注最坏情况的界限,如果特定群体的外观差异超过预设阈值,则认为该系统是不公平的。我们还探索了用于评估交叉公平性相对完整性的组合测试。通过界定最坏情况,我们在代理框架内开发了一种用于实现条件公平性的提示注入方案,最小干预即可实现,已在最先进的生成式AI系统上进行验证。

关键词

引用

@article{arxiv.2404.16663,
  title  = {Runtime Monitoring and Enforcement of Conditional Fairness in Generative AIs},
  author = {Chih-Hong Cheng and Changshun Wu and Xingyu Zhao and Saddek Bensalem and Harald Ruess},
  journal= {arXiv preprint arXiv:2404.16663},
  year   = {2025}
}