中文

面向政治倾向大语言模型的多维审计

计算与语言 2026-04-28 v1

摘要

随着大型语言模型 (LLM) 在各行业的应用日益广泛,关于其潜在滥用尤其在政治话语等敏感领域的担忧日益增长。通过提示工程或微调技术将 LLM deliberately 对齐特定政治意识形态,可能在政治活动等用例中具有优势,但需要谨慎考虑,由于可能导致性能下降、误导或增加偏见行为。本文提出一种受哈贝马斯 communicative action theory 启发的多维框架,用于审计通过微调或角色扮演方式对齐的九个流行 LLM,审计维度包括有效性、公平性、真实性和说服力,使用自动化、量化指标。将其应用于九个通过微调或角色扮演对齐的流行 LLM,结果显示出一致的权衡:虽然较大的模型在角色扮演政治意识形态方面更有效,并且在其响应中更真实,但它们也更不公平,表现出更高的偏见水平,表现为对不同意识形态的人群表现出愤怒和有毒的语言。微调模型相对于相应的角色扮演模型表现出较低的偏见和更有效的对齐,但也会导致推理任务性能下降并增加幻觉现象。总体而言,测试的所有模型在上述四个指标中至少有一个方面都存在不足,凸显需要更平衡和稳健的对齐策略的必要性。最终,本工作旨在确保政治对齐的 LLM 生成合法且无害的论点,提供一个用于评估这些模型负责任政治对齐的框架。

关键词

引用

@article{arxiv.2604.24429,
  title  = {A Multi-Dimensional Audit of Politically Aligned Large Language Models},
  author = {Lisa Korver and Mohamed Mostagir and Sherief Reda},
  journal= {arXiv preprint arXiv:2604.24429},
  year   = {2026}
}