中文

将偏见检测作为提升偏见检测效果的催化剂:多任务学习方法

计算与语言 2025-07-03 v1

摘要

语言模型中的偏见和刻板印象可能导致伤害,尤其是在内容 moderation 和决策等敏感领域。本文通过探讨在联合学习这些任务如何增强模型性能来解决偏见和刻板印象检测问题。我们引入了 StereoBias 数据集,用于跨五个类别(宗教、性别、社会经济地位、种族、职业及其他)的偏见和刻板印象检测标注,使我们能够更深入地研究它们之间的关系。我们的实验比较了仅编码模型和使用 QLoRA 的微调解码器模型。虽然仅编码模型表现良好,但解码器模型也显示出竞争性的结果。关键的是,针对偏见和刻板印象检测的联合训练显著优于分别训练的偏见检测。额外的情感分析实验确认,这些改进来自于偏见和刻板印象之间的联系,而不仅仅是多任务学习本身。这些发现突显了利用刻板印象信息构建更公平、更有效的 AI 系统的价值。

关键词

引用

@article{arxiv.2507.01715,
  title  = {Stereotype Detection as a Catalyst for Enhanced Bias Detection: A Multi-Task Learning Approach},
  author = {Aditya Tomar and Rudra Murthy and Pushpak Bhattacharyya},
  journal= {arXiv preprint arXiv:2507.01715},
  year   = {2025}
}