中文

NLPCC 2025 共享任务概述:性别偏见缓解挑战

计算与语言 2025-06-17 v1

摘要

随着自然语言处理在性别偏见方面的研究成为一个重要的跨学科主题,主流的数据驱动技术(如预训练语言模型)受到偏见语料库的困扰。这一问题在那些公平性相关的计算语言学资源较少的语言(如中文)中更为明显。为此,我们提出了中文性别偏见探测与缓解语料库(CORGI-PM),包含 32.9k 个句子,其高质量标签遵循专门针对中文语境中性别偏见开发的标注方案。值得注意的是,CORGI-PM 包含 5.2k 个性别偏见句子以及由人工标注者重写的相应偏见消除版本。我们提出了三个挑战作为共享任务,以自动化文本性别偏见的缓解,要求模型检测、分类和缓解文本性别偏见。在文献中,我们展示了参与 NLPCC 2025 共享任务的各团队的结果和分析。

关键词

引用

@article{arxiv.2506.12574,
  title  = {Overview of the NLPCC 2025 Shared Task: Gender Bias Mitigation Challenge},
  author = {Yizhi Li and Ge Zhang and Hanhua Hong and Yiwen Wang and Chenghua Lin},
  journal= {arXiv preprint arXiv:2506.12574},
  year   = {2025}
}