中文

抵御操纵性 AI:关键因素与可能的行动

人机交互 2024-10-01 v2

摘要

如果 AI 是新的电力,那么我们该如何防止自己受到电击?本文探讨了大型语言模型 (LLM) 操纵人类决策潜力相关的因素。我们描述了两项实验的结果,这些实验旨在确定人类特征与其对 LLM 操纵的易感性相关,以及 LLM 特征与其操纵潜力相关。我们通过设计人类因素的实验,让参与者使用 LLM 生成的提示回答常识问题;通过设计 LLM 因素的实验,促使语言模型创建操纵性陈述。然后,我们分析了他们的服从情况、所使用的说服策略以及词汇选择。基于这些实验,我们讨论了两种可以保护我们免受 LLM 操纵的行动。长期来看,我们将 AI 素养置于首位,认为教育社会将最小化操纵及其后果的风险。我们还提出一种临时解决方案:一种检测 LLM 操纵的分类器——“操纵融合”。

关键词

引用

@article{arxiv.2404.14230,
  title  = {Resistance Against Manipulative AI: key factors and possible actions},
  author = {Piotr Wilczyński and Wiktoria Mieleszczenko-Kowszewicz and Przemysław Biecek},
  journal= {arXiv preprint arXiv:2404.14230},
  year   = {2024}
}

备注

Accepted for the 27th European Conference on Artificial Intelligence (ECAI)