见杂草中之良种:面向有益用途的生成式AI绿色组队
人机交互
2023-06-07 v1 人工智能
摘要
像GPT和DALL-E这样的大型生成式AI模型(GMs)被训练用于生成通用、广泛用途的内容。GM内容过滤器被泛化以过滤掉在许多情况下存在危害风险的内容,例如仇恨言论。然而,被禁止的内容并非总有害——存在生成被禁止内容反而有益的情况。因此,当GM过滤掉内容时,它们将有益用例与有害用例一同排除了。哪些用例被排除反映了GM内容过滤中所嵌入的价值观。近期关于红队(red teaming)的工作提出了绕过GM内容过滤器以生成有害内容的方法。我们创造了术语绿色组队(green teaming)来描述绕过GM内容过滤器以设计有益用例的方法。我们通过以下方式展示绿色组队:1)使用ChatGPT作为虚拟患者模拟有自杀意念的人,用于自杀支持培训;2)使用Codex故意生成有bug的解决方案来训练学生调试;3)使用Midjourney生成反LGBTQ+政客穿异装的图像来考察一个Instagram页面。最后,我们讨论了我们的用例如何展示绿色组队既是一种实用设计方法,也是一种批判模式,它质疑并颠覆了当前对生成式AI中危害与价值观的理解。
引用
@article{arxiv.2306.03097,
title = {Seeing Seeds Beyond Weeds: Green Teaming Generative AI for Beneficial Uses},
author = {Logan Stapleton and Jordan Taylor and Sarah Fox and Tongshuang Wu and Haiyi Zhu},
journal= {arXiv preprint arXiv:2306.03097},
year = {2023}
}