生成式语言模型与自动化影响行动:新兴威胁与潜在缓解措施
计算机与社会
2023-01-12 v1
摘要
生成式语言模型已取得显著进步,如今能够生成难以与人类撰写内容区分的逼真文本输出。对于恶意行为者而言,这些语言模型有望自动生成具有说服力且具误导性的文本,用于影响行动。本报告评估了语言模型未来可能如何改变影响行动,以及可采取哪些步骤来缓解这一威胁。我们梳理了在线影响行动的行为主体、行为和内容可能发生的变化,并提供了一个针对语言模型到影响行动流程各阶段的缓解框架(模型构建、模型访问、内容传播和信念形成)。尽管任何合理的缓解措施都无法完全阻止 AI 赋能的影响行动威胁,但多种缓解措施的组合可能产生重要影响。
引用
@article{arxiv.2301.04246,
title = {Generative Language Models and Automated Influence Operations: Emerging Threats and Potential Mitigations},
author = {Josh A. Goldstein and Girish Sastry and Micah Musser and Renee DiResta and Matthew Gentzel and Katerina Sedova},
journal= {arXiv preprint arXiv:2301.04246},
year = {2023}
}
备注
82 pages, 26 figures