GPT-3 与先进神经语言模型的激进化风险
计算机与社会
2020-09-16 v1 人工智能
摘要
在本文中,我们通过对 GPT-3 的评估扩展了我们此前关于生成式语言模型被滥用潜力的研究。利用代表不同类型极端主义叙事、社会互动结构与激进意识形态的提示进行实验,我们发现 GPT-3 在生成极端主义文本方面较其前身 GPT-2 有显著改进。我们还展示了 GPT-3 在生成能够准确模拟互动性、信息性与影响力内容方面的能力,这些内容可被用于使个体激进化而走向暴力极右极端主义意识形态与行为。尽管 OpenAI 的预防措施较为有力,但未经监管的山寨技术出现的可能性代表了大规模在线激进化与招募的重大风险;因此,在缺乏 safeguards 的情况下,几乎无需试验即可成功且高效地武器化是可能的。AI 利益相关方、政策制定群体与政府应尽早投资于建立社会规范、公共政策与教育倡议,以 preempt 机器生成虚假信息与宣传的涌入。缓解措施将需要跨行业、政府与公民社会的有效政策与伙伴关系。
引用
@article{arxiv.2009.06807,
title = {The Radicalization Risks of GPT-3 and Advanced Neural Language Models},
author = {Kris McGuffie and Alex Newhouse},
journal= {arXiv preprint arXiv:2009.06807},
year = {2020}
}