大型语言模型中政治意见的细粒度解读
计算与语言
2025-06-06 v1 人工智能
机器学习
摘要
目前对大型语言模型(LLM)政治意见的研究主要依赖对其开放式回应的评估。近期研究表明,LLM的回应与其内部意图之间存在偏差。这促使我们探测LLM的内部机制,以帮助揭示其内部政治状态。此外,我们发现,对LLM政治意见的分析常依赖单轴概念,可能导致概念混淆。本文将单轴扩展为多维度,并应用可解释表示工程技术,以实现更透明的LLM政治概念学习。具体而言,我们设计了四维政治学习框架,并构建了相应的数据集用于细粒度政治概念向量学习。这些向量可用于检测和干预LLM的内部表征。实验在八个开源LLM上进行,采用三种表示工程技术。结果表明,这些向量能够消解政治概念混淆。检测任务验证了向量的语义意义,并在越域测试中表现出良好的泛化性和鲁棒性。干预实验表明,这些向量能够干预LLM以生成不同政治倾向的回应。
引用
@article{arxiv.2506.04774,
title = {Fine-Grained Interpretation of Political Opinions in Large Language Models},
author = {Jingyu Hu and Mengyue Yang and Mengnan Du and Weiru Liu},
journal= {arXiv preprint arXiv:2506.04774},
year = {2025}
}