中文

道德透镜与政治坐标:面向具有道德条件约束的 LLM 的意识形态定位

计算与语言 2026-01-14 v1 人工智能

摘要

尽管近期研究已系统地记录了大语言模型 (LLM) 的政治取向,但现有评估主要依赖直接探测或人口统计学角色工程来揭示意识形态偏见。然而,在社会心理学中,政治意识形态也被理解为基本道德直觉的下游结果。在本工作中,我们通过将道德取向作为可控条件,研究道德价值观与政治定位之间的因果关系。我们并非简单地分配人口统计学角色,而是对模型进行条件约束,使其支持或拒绝特定的道德价值观,并使用政治罗盘测试评估其政治取向的相应变化。通过将道德价值观视为透镜,我们观察了道德条件约束如何主动引导模型在经济和社会维度上的轨迹。我们的研究结果表明,此类条件约束会在模型的政治坐标中引发显著的、特定于价值观的变化。我们进一步注意到,这些效应受到角色框架和模型规模的系统性调节,并且在实例化相同道德价值观的替代评估工具中表现出鲁棒性。这凸显了有效的对齐需要将政治评估锚定在包括道德在内的更广泛社会价值观背景中,为更具社会基础的对齐技术铺平了道路。

关键词

引用

@article{arxiv.2601.08634,
  title  = {Moral Lenses, Political Coordinates: Towards Ideological Positioning of Morally Conditioned LLMs},
  author = {Chenchen Yuan and Bolei Ma and Zheyu Zhang and Bardh Prenkaj and Frauke Kreuter and Gjergji Kasneci},
  journal= {arXiv preprint arXiv:2601.08634},
  year   = {2026}
}