中文

基于多语言Transformer模型的性别歧视自动检测

计算与语言 2022-02-09 v2 人工智能

摘要

近年来,性别歧视已成为社交网络上日益严重的重大问题。IberLEF 2021 上首届社交网络性别歧视识别(EXIST)共享任务是一项自然语言处理(NLP)领域的国际竞赛,旨在应用机器学习方法自动识别社交媒体内容中的性别歧视。为此,性别歧视检测被构建为一个粗粒度(二分类)分类问题和一个细粒度分类任务,后者区分多种类型的性别歧视内容(例如支配、刻板印象和物化)。本文介绍了 AIT_FHSTP 团队在 EXIST2021 基准上针对两项任务的贡献。为解决这些任务,我们应用了两个多语言 transformer 模型,一个基于多语言 BERT,另一个基于 XLM-R。我们的方法采用两种不同策略使 transformer 适应性别歧视内容检测:第一,利用额外数据进行无监督预训练;第二,利用额外及增强数据进行有监督微调。对于两项任务,我们的最佳模型均为 XLM-R,其在 EXIST 数据及额外数据集上进行了无监督预训练,并在提供的数据集上进行了微调。二分类(任务1)的最佳运行取得了 0.7752 的宏 F1 分数,在基准中排名第 5;对于多分类(任务2),我们的最佳提交以 0.5589 的宏 F1 分数排名第 6。

关键词

引用

@article{arxiv.2106.04908,
  title  = {Automatic Sexism Detection with Multilingual Transformer Models},
  author = {Mina Schütz and Jaqueline Boeck and Daria Liakhovets and Djordje Slijepčević and Armin Kirchknopf and Manuel Hecht and Johannes Bogensperger and Sven Schlarb and Alexander Schindler and Matthias Zeppelzauer},
  journal= {arXiv preprint arXiv:2106.04908},
  year   = {2022}
}

备注

Technical Report to the AIT_FHSTP EXIST 2021 Challenge contribution (under review) http://nlp.uned.es/exist2021/