抵御操纵性 AI:关键因素与可能的行动
人机交互
2024-10-01 v2
摘要
如果 AI 是新的电力,那么我们该如何防止自己受到电击?本文探讨了大型语言模型 (LLM) 操纵人类决策潜力相关的因素。我们描述了两项实验的结果,这些实验旨在确定人类特征与其对 LLM 操纵的易感性相关,以及 LLM 特征与其操纵潜力相关。我们通过设计人类因素的实验,让参与者使用 LLM 生成的提示回答常识问题;通过设计 LLM 因素的实验,促使语言模型创建操纵性陈述。然后,我们分析了他们的服从情况、所使用的说服策略以及词汇选择。基于这些实验,我们讨论了两种可以保护我们免受 LLM 操纵的行动。长期来看,我们将 AI 素养置于首位,认为教育社会将最小化操纵及其后果的风险。我们还提出一种临时解决方案:一种检测 LLM 操纵的分类器——“操纵融合”。
引用
@article{arxiv.2404.14230,
title = {Resistance Against Manipulative AI: key factors and possible actions},
author = {Piotr Wilczyński and Wiktoria Mieleszczenko-Kowszewicz and Przemysław Biecek},
journal= {arXiv preprint arXiv:2404.14230},
year = {2024}
}
备注
Accepted for the 27th European Conference on Artificial Intelligence (ECAI)