中文

超越偏见分数:揭示小型语言模型的虚假中性

计算与语言 2026-02-10 v3 人工智能

摘要

小型语言模型(Small Language Models, SLMs)在资源受限的应用中迅速获得采纳,但我们对其伦理与公平性影响的理解跟上了。这一差距引发了我们引入虚假中性框架(Vacuous Neutrality Framework, VaNeu)——一种旨在部署前评估 SLMs 公平性的多维评估范式。该框架跨越四个阶段:偏见、效用、歧义处理及位置偏见,涵盖多样社会偏见类别。据我们所知,本工作是对 0.5-5B 参数范围内 SLMs 进行的大规模审计,这一被忽略的“中端”位于 BERT 级编码器与旗舰 LLM 之间。我们在模糊和明确语境下评估了九个广泛使用的 SLMs,涵盖四个模型家族。我们的发现表明,表现出低偏见的模型在后续评估中常常失败,暴露出隐藏的脆弱性和不可靠的推理能力。这些结果凸显了我们需要更全面地理解 SLMs 在公平性和可靠性方面的表现,并将该框架置于负责任在社会敏感场景中部署的原则工具。

关键词

引用

@article{arxiv.2506.08487,
  title  = {Beyond Bias Scores: Unmasking Vacuous Neutrality in Small Language Models},
  author = {Sumanth Manduru and Carlotta Domeniconi},
  journal= {arXiv preprint arXiv:2506.08487},
  year   = {2026}
}

备注

Accepted at EACL 2026 Student Research Workshop