中文

揭开AI的阴影:探究大语言模型中的欺骗能力

计算与语言 2024-03-18 v1 人工智能

摘要

本研究批判性地审视了AI欺骗的复杂图景,重点关注大语言模型(LLMs)的欺骗行为。我的目标是阐明这一问题,审视围绕它的讨论,并进而深入探讨其分类和影响。本文首先评估了2023年AI安全峰会(ASS)并介绍了LLMs,强调了构成其欺骗行为基础的多维偏见。文献综述涵盖了四种分类的欺骗类型:战略欺骗、模仿、谄媚和不忠实推理,以及它们所蕴含的社会影响和风险。最后,我对与应对欺骗性AI持续挑战相关的各个方面采取了评估立场。这包括对国际协作治理的考量、个人与AI互动方式的重构、实际调整建议的提出,以及数字教育的特定要素。

关键词

引用

@article{arxiv.2403.09676,
  title  = {Unmasking the Shadows of AI: Investigating Deceptive Capabilities in Large Language Models},
  author = {Linge Guo},
  journal= {arXiv preprint arXiv:2403.09676},
  year   = {2024}
}

备注

AI deception, Large Language Models, ChatGPT