论文蒸馏:探究 NLP 模型中的偏差对仇恨言论检测的影响
计算与语言
2023-12-06 v2
摘要
本文为我博士论文工作的总结。我从可解释性、攻击性刻板印象偏差与公平性三个视角,探究 NLP 模型中的偏差对仇恨言论检测任务的影响。随后,我讨论论文的主要结论及其如何惠及更广泛的 NLP 社区。最后,我讨论重要的未来研究方向。我的论文发现表明,NLP 模型中的偏差从所有三个视角均影响仇恨言论检测任务,且除非我们开始在 NLP 模型偏差研究中纳入社会科学,否则将无法有效克服当前测量与缓解 NLP 模型偏差的局限。
引用
@article{arxiv.2308.16549,
title = {Thesis Distillation: Investigating The Impact of Bias in NLP Models on Hate Speech Detection},
author = {Fatma Elsafoury},
journal= {arXiv preprint arXiv:2308.16549},
year = {2023}
}