中文

AI 欺骗:实例、风险与潜在解决方案综述

计算机与社会 2023-08-29 v1 人工智能 人机交互

摘要

本文主张一系列当前的 AI 系统已经学会如何欺骗人类。我们将欺骗定义为在追求真理以外的某种结果时有系统地诱导他人产生错误信念。我们首先调研了 AI 欺骗的实证例子,讨论了为特定竞争情境构建的专用 AI 系统(包括 Meta 的 CICERO)以及通用 AI 系统(如大语言模型)。接下来,我们详述了 AI 欺骗带来的若干风险,例如欺诈、选举篡改以及失去对 AI 系统的控制。最后,我们概述了针对 AI 欺骗所引发问题的若干潜在解决方案:第一,监管框架应要求具备欺骗能力的 AI 系统接受严格的风险评估;第二,政策制定者应实施 bot-or-not 法律;最后,政策制定者应优先资助相关研究,包括检测 AI 欺骗以及降低 AI 系统欺骗性的工具。政策制定者、研究人员以及更广泛的公众应主动作为,防止 AI 欺骗破坏我们社会共有的基础。

关键词

引用

@article{arxiv.2308.14752,
  title  = {AI Deception: A Survey of Examples, Risks, and Potential Solutions},
  author = {Peter S. Park and Simon Goldstein and Aidan O'Gara and Michael Chen and Dan Hendrycks},
  journal= {arXiv preprint arXiv:2308.14752},
  year   = {2023}
}

备注

18 pages (not including executive summary, references, and appendix), six figures