中文

ID-XCB:面向公平且准确的基于Transformer的网络欺凌检测的数据无关去偏方法

计算与语言 2024-02-28 v2

摘要

脏话是收集网络欺凌事件数据集的常见代理。我们关注的是测量和减轻由于脏话与事件之间的虚假关联而产生的偏差,这些关联是此类数据收集策略的结果。在展示并量化这些偏差后,我们引入了ID-XCB,这是第一种数据无关的去偏技术,它结合了对抗训练、偏差约束和去偏微调方法,旨在减轻模型对偏差诱导词的关注,同时不影响整体模型性能。我们在两个流行的基于会话的网络欺凌数据集上探索了ID-XCB,并进行了全面的消融和泛化研究。我们表明,ID-XCB在减轻偏差的同时学习了鲁棒的网络欺凌检测能力,在性能和偏差缓解方面均优于最先进的去偏方法。我们的定量和定性分析证明了其对未见数据的泛化能力。

关键词

引用

@article{arxiv.2402.16458,
  title  = {ID-XCB: Data-independent Debiasing for Fair and Accurate Transformer-based Cyberbullying Detection},
  author = {Peiling Yi and Arkaitz Zubiaga},
  journal= {arXiv preprint arXiv:2402.16458},
  year   = {2024}
}