探究大型语言模型的微妙意识形态操纵
计算与语言
2025-04-22 v1 计算机与社会
摘要
大型语言模型(LLM)已彻底变革了自然语言处理,但关于其在政治敏感领域易受意识形态操纵的担忧日益增加。先前工作集中于二元的左-右 LLM 偏见,使用明确提示和针对政治问答数据集的微调。在本工作中,我们超越了这种二元方法,探讨 LLM 在从 Progressive-Left 到 Conservative-Right 广泛政治意识形态谱系上的受影响程度。我们引入了一个新型多任务数据集,通过意识形态问答、声明排序、演讲遮盖完成和国会议案理解等任务来反映 diverse 政治意识形态位置。通过在该数据集上对三个 LLM(Phi-2、Mistral 和 Llama-3)进行微调,我们评估它们采纳和表达这些细腻意识形态的能力。我们的发现表明,微调显著增强了细腻意识形态对齐,而明确提示仅提供微小的改进。这突显了模型易受细微意识形态操纵的潜力,表明需要更健全的措施来缓解这些风险。
引用
@article{arxiv.2504.14287,
title = {Probing the Subtle Ideological Manipulation of Large Language Models},
author = {Demetris Paschalides and George Pallis and Marios D. Dikaiakos},
journal= {arXiv preprint arXiv:2504.14287},
year = {2025}
}