大型语言模型会成为会说谎者吗?
密码学与安全
2024-10-15 v1 人工智能
计算与语言
计算机与社会
机器学习
摘要
大型语言模型(LLM)因其能力和帮助fulness 而赢得人类信任。然而,这反过来可能使 LLM 能够通过操纵语言影响用户的心态,这被称为“gaslighting”,即一种心理效应。在本工作中,我们旨在调查在基于提示的和基于微调的“gaslighting”攻击下的 LLM 漏洞。因此,我们提出了一个两阶段框架 DeepCoG,用于:1)通过提出的 DeepGaslighting 提示模板从 LLM 中引导出“gaslighting”计划,以及2)通过我们的 Chain-of-Gaslighting 方法从 LLM 中获取“gaslighting”对话。针对开源 LLM 进行基于提示的和基于微调的攻击,还附带相应的安全数据集。实验表明,无论是基于提示的还是基于微调的攻击,都能将三个开源 LLM 转化为会说谎者。相比之下,我们提出了三种安全对齐策略,以提高(提高了 12.05%) LLM 的安全警戒。我们的安全对齐策略对 LLM 的实用性几乎没有影响。经验研究表明,即使 LLM 在一般有害查询上的有害性测试中通过了,LLM 也可能是潜在的会说谎者。
引用
@article{arxiv.2410.09181,
title = {Can a large language model be a gaslighter?},
author = {Wei Li and Luyao Zhu and Yang Song and Ruixi Lin and Rui Mao and Yang You},
journal= {arXiv preprint arXiv:2410.09181},
year = {2024}
}
备注
10/26 (Main Body/Total), 8 figures