transforming Dutch: Debiasing Dutch Coreference Resolution Systems for Non-binary Pronouns
计算与语言
2024-05-02 v1 人工智能
摘要
性别中性代词正在跨越西方语言。然而,最近的评估表明,英语 NLP 系统无法正确处理性别中性代词,可能导致消除和误判非二元个体。本文考察了荷兰语指代消解系统在性别中性代词(hen 与 die)上的表现。荷兰语中的这些代词仅于 2016 年引入,而英语中单数 they 已存在多年。我们此外比较两种在非二元上下文中进行指代消解系统去偏置的技术:反事实数据增强(CDA)与去词化。此外,由于从诸如 LEA 等通用评估指标难以解释代词表现,我们引入一种创新的评估指标,即代词得分,其直接表示正确处理的代词比例。我们的结果显示,性别中性代词的表现低于性别化代词。尽管如此,尽管去词化未能带来改进,CDA 显著缩小了性别化与性别中性代词之间的性能差距。我们进一步表明,CDA 在资源有限的情形下仍然有效,即仅使用有限的去偏置文档。该效果扩展到以往看不见的新型代词(neopronouns),这些代词目前使用频率不高,但可能在未来获得流行,凸显了仅用极少资源和低计算成本即可实现有效去偏置的可行性。
引用
@article{arxiv.2405.00134,
title = {Transforming Dutch: Debiasing Dutch Coreference Resolution Systems for Non-binary Pronouns},
author = {Goya van Boven and Yupei Du and Dong Nguyen},
journal= {arXiv preprint arXiv:2405.00134},
year = {2024}
}
备注
22 pages, 2 figures. Accepted at the 2024 ACM Conference on Fairness, Accountability, and Transparency (FAccT '24)