中文

BIPOLAR:基于极化的LLM偏见评估粒度框架

计算与语言 2025-08-18 v1

摘要

大型语言模型(LLM)已知在下游任务中会表现出偏见,尤其是在处理涉及政治话语、性别身份、族群关系或民族刻板印象等敏感话题时。尽管已在偏见检测与缓解技术方面取得显著进展,但仍有若干挑战未被充分探讨。本研究提出了一个可复用、粒度细致且主题中性的框架,用于评估LLM(包括开源和闭源模型)中的极化相关偏见。我们的 метод结合了对极化敏感情感指标与合成生成的平衡冲突相关语句数据集,采用预定义的语义类别进行分析。作为案例研究,我们创建了一个聚焦俄乌战争的合成数据集,并评估了Llama-3、Mistral、GPT-4、Claude 3.5和Gemini 1.0等多个LLM的偏见。除整体偏见得分外,框架允许进行粒度细致的分析,显示在不同语义类别之间存在显著差异,揭示了模型之间呈现出不同的行为模式。对提示修改的适应性测试显示,偏见进一步倾向于预设语言和国籍修改。总体而言,本框架支持自动化数据集生成和粒度偏见评估,可适用于各种极化驱动的场景和主题,与许多其他偏见评估策略是正交的。

关键词

引用

@article{arxiv.2508.11061,
  title  = {BIPOLAR: Polarization-based granular framework for LLM bias evaluation},
  author = {Martin Pavlíček and Tomáš Filip and Petr Sosík},
  journal= {arXiv preprint arXiv:2508.11061},
  year   = {2025}
}