大型语言模型对意识形态操纵的易感性如何?
计算与语言
2024-06-19 v3 密码学与安全
计算机与社会
摘要
大型语言模型 (LLMs) 具有对公众认知和信息互动施加重大影响的潜力。如果这些模型内的意识形态容易被操纵,这就引发了对社会影响的担忧。在本工作中,我们调查了 LLMs 从其指令微调数据中学习和泛化意识形态偏见的有效程度。我们的研究结果揭示了一个令人担忧的脆弱性:仅暴露于少量意识形态驱动的样本就会显著改变 LLMs 的意识形态。值得注意的是,LLMs 表现出惊人的能力,能够从一个主题吸收意识形态并将其泛化到甚至不相关的主题。LLMs 意识形态容易被扭曲的便利性突显了恶意行为者故意投毒训练数据或数据标注者无意中引入偏见所带来的风险。这也强调了必须建立强有力的保障措施,以减轻意识形态操纵对 LLMs 的影响。
引用
@article{arxiv.2402.11725,
title = {How Susceptible are Large Language Models to Ideological Manipulation?},
author = {Kai Chen and Zihao He and Jun Yan and Taiwei Shi and Kristina Lerman},
journal= {arXiv preprint arXiv:2402.11725},
year = {2024}
}