中文

Lou 数据集——探索德语文本分类中性别公平语言的影响

计算与语言 2024-09-27 v1

摘要

性别公平语言是一种正在发展的德语语言变体,通过针对所有性别或使用中性形式来促进包容性。然而,缺乏资源来评估这一语言变迁对使用语言模型(LM)进行分类的影响,而语言模型可能未在此类变体上进行训练。为解决这一差距,我们提出 Lou,这是第一个涵盖七个任务的高质量改写德语文本分类数据集,如立场检测和毒性分类。对 16 个单语言和多语言 LM 在 Lou 上的评估显示,性别公平语言对预测结果产生显著影响,通过翻转标签、降低确定性和改变注意力模式来实现。然而,现有评估仍然有效,因为 LM 对原始和改写实例的排名差异不大。虽然我们提供了关于德语文本分类影响的初始见解,但所发现的模式也可能适用于其他语言,观察到的模式在多语言和英语 LM 中也表现出一致性。

关键词

引用

@article{arxiv.2409.17929,
  title  = {The Lou Dataset -- Exploring the Impact of Gender-Fair Language in German Text Classification},
  author = {Andreas Waldis and Joel Birrer and Anne Lauscher and Iryna Gurevych},
  journal= {arXiv preprint arXiv:2409.17929},
  year   = {2024}
}