中文

论文蒸馏:探究 NLP 模型中的偏差对仇恨言论检测的影响

计算与语言 2023-12-06 v2

摘要

本文为我博士论文工作的总结。我从可解释性、攻击性刻板印象偏差与公平性三个视角,探究 NLP 模型中的偏差对仇恨言论检测任务的影响。随后,我讨论论文的主要结论及其如何惠及更广泛的 NLP 社区。最后,我讨论重要的未来研究方向。我的论文发现表明,NLP 模型中的偏差从所有三个视角均影响仇恨言论检测任务,且除非我们开始在 NLP 模型偏差研究中纳入社会科学,否则将无法有效克服当前测量与缓解 NLP 模型偏差的局限。

关键词

引用

@article{arxiv.2308.16549,
  title  = {Thesis Distillation: Investigating The Impact of Bias in NLP Models on Hate Speech Detection},
  author = {Fatma Elsafoury},
  journal= {arXiv preprint arXiv:2308.16549},
  year   = {2023}
}