生成式模型内容审核的安全性与公平性
机器学习
2023-06-13 v1 人工智能
摘要
随着生成式AI的重大进展,具备生成组件的新技术正迅速部署。生成式模型通常在大型数据集上训练,导致模型行为可能模仿训练数据中最糟糕的内容。生成式技术的负责任部署需要内容审核策略,例如安全输入与输出过滤器。在此,我们提供一个理论框架,用于概念化文本到图像生成式技术负责任的内容审核,包括如何经验性地度量我们所列举的构念的演示。我们定义并区分安全性、公平性与度量公平性的概念,并列举各领域中可能出现的危害实例。随后,我们演示如何对所指明的危害进行量化。最后,我们总结所演示的危害量化风格如何支持数据驱动的内容审核决策。
引用
@article{arxiv.2306.06135,
title = {Safety and Fairness for Content Moderation in Generative Models},
author = {Susan Hao and Piyush Kumar and Sarah Laszlo and Shivani Poddar and Bhaktipriya Radharapu and Renee Shelby},
journal= {arXiv preprint arXiv:2306.06135},
year = {2023}
}
备注
CVPR Workshop Paper