中文

基于意识形态的 LLM 用于内容审核

计算与语言 2025-10-31 v1

摘要

大型语言模型(LLM)越来越多地用于内容审核系统,其中确保公平性和中立性至关重要。本研究考察了人格化对不同 LLM 架构、模型规模以及内容模态(语言 vs. 视觉)下有害内容分类一致性和公平性的影响。首先,显眼的性能指标表明人格化对整体分类准确率影响不大。然而,更深入的分析揭示了重要的行为变化。不同意识形态倾向的人格显示出将内容标记为有害的不同倾向,表明模型通过何种“视角”观察输入会微妙地影响其判断。进一步的一致性分析表明,特别是较大的模型,倾向于与来自相同政治意识形态的人格更 closely 一致,从而加强了同一意识形态内部的一致性,同时扩大了不同意识形态之间的差异。为更直观地展示这一效果,我们对了一个政治针对性任务进行了额外研究,结果确认人格不仅在自身意识形态内部更具一致性,而且倾向于为其立场辩护,同时淡化对相互意见的有害性。总体而言,这些发现突显了人格化条件如何引入细微的意识形态偏见到 LLM 输出中,对使用可能在表面上中立的 AI 系统强化partisan观点的担忧。

关键词

引用

@article{arxiv.2510.25805,
  title  = {Ideology-Based LLMs for Content Moderation},
  author = {Stefano Civelli and Pietro Bernardelle and Nardiena A. Pratama and Gianluca Demartini},
  journal= {arXiv preprint arXiv:2510.25805},
  year   = {2025}
}