中文

基于机制的方法用于缓解生成式 AI 的有害影响

计算机与社会 2024-04-24 v1 人工智能

摘要

最近的生成式 AI 系统已展现出更高级的说服能力,并在越来越多的生活领域渗透其中,这些领域中会影响决策。生成式 AI 因具有 reciprocal exchange(互惠交换)和持续互动的机会,呈现出新的说服风险轮廓。这引发了对 AI 说服潜在危害及其如何加以缓解的日益关注,凸显了系统性研究 AI 说服的必要性。当前关于 AI 说服的定义尚不明确,且相关危害的研究不足。现有的危害缓解方法优先考虑说服结果中的危害,而忽视说服过程中的危害。本文为系统性研究 AI 说服奠定了基础。我们首先提出了生成式说服 AI 的定义。我们区分了基于提供相关事实、 sound reasoning(稳健推理)或其他可信证据形式的理性说服生成式 AI,以及依赖利用认知偏差和启发式或误导性信息的操纵性生成式 AI。我们还提出了 AI 说服危害的地图,包括经济、物理、环境、心理、社会文化、政治、隐私和自主权危害的定义与实例。随后,我们引入了贡献于有害说服的机制图景。最后,我们概述了可用于缓解说服过程危害的措施,包括用于操纵分类的提示工程和红队测试。未来工作将使这些缓解措施可操作化,并研究不同说服机制之间的相互作用。

关键词

引用

@article{arxiv.2404.15058,
  title  = {A Mechanism-Based Approach to Mitigating Harms from Persuasive Generative AI},
  author = {Seliem El-Sayed and Canfer Akbulut and Amanda McCroskery and Geoff Keeling and Zachary Kenton and Zaria Jalan and Nahema Marchal and Arianna Manzini and Toby Shevlane and Shannon Vallor and Daniel Susser and Matija Franklin and Sophie Bridgers and Harry Law and Matthew Rahtz and Murray Shanahan and Michael Henry Tessler and Arthur Douillard and Tom Everitt and Sasha Brown},
  journal= {arXiv preprint arXiv:2404.15058},
  year   = {2024}
}