中文

探究大型语言模型的微妙意识形态操纵

计算与语言 2025-04-22 v1 计算机与社会

摘要

大型语言模型(LLM)已彻底变革了自然语言处理,但关于其在政治敏感领域易受意识形态操纵的担忧日益增加。先前工作集中于二元的左-右 LLM 偏见,使用明确提示和针对政治问答数据集的微调。在本工作中,我们超越了这种二元方法,探讨 LLM 在从 Progressive-Left 到 Conservative-Right 广泛政治意识形态谱系上的受影响程度。我们引入了一个新型多任务数据集,通过意识形态问答、声明排序、演讲遮盖完成和国会议案理解等任务来反映 diverse 政治意识形态位置。通过在该数据集上对三个 LLM(Phi-2、Mistral 和 Llama-3)进行微调,我们评估它们采纳和表达这些细腻意识形态的能力。我们的发现表明,微调显著增强了细腻意识形态对齐,而明确提示仅提供微小的改进。这突显了模型易受细微意识形态操纵的潜力,表明需要更健全的措施来缓解这些风险。

关键词

引用

@article{arxiv.2504.14287,
  title  = {Probing the Subtle Ideological Manipulation of Large Language Models},
  author = {Demetris Paschalides and George Pallis and Marios D. Dikaiakos},
  journal= {arXiv preprint arXiv:2504.14287},
  year   = {2025}
}