揭开AI的阴影:探究大语言模型中的欺骗能力
计算与语言
2024-03-18 v1 人工智能
摘要
本研究批判性地审视了AI欺骗的复杂图景,重点关注大语言模型(LLMs)的欺骗行为。我的目标是阐明这一问题,审视围绕它的讨论,并进而深入探讨其分类和影响。本文首先评估了2023年AI安全峰会(ASS)并介绍了LLMs,强调了构成其欺骗行为基础的多维偏见。文献综述涵盖了四种分类的欺骗类型:战略欺骗、模仿、谄媚和不忠实推理,以及它们所蕴含的社会影响和风险。最后,我对与应对欺骗性AI持续挑战相关的各个方面采取了评估立场。这包括对国际协作治理的考量、个人与AI互动方式的重构、实际调整建议的提出,以及数字教育的特定要素。
引用
@article{arxiv.2403.09676,
title = {Unmasking the Shadows of AI: Investigating Deceptive Capabilities in Large Language Models},
author = {Linge Guo},
journal= {arXiv preprint arXiv:2403.09676},
year = {2024}
}
备注
AI deception, Large Language Models, ChatGPT