中文

取其精华,去其糟粕!通过反事实因果效应进行有毒语言检测的去偏

计算与语言 2024-06-04 v1 人工智能

摘要

当前的有毒语言检测(TLD)方法通常依赖特定词元进行决策,这使得它们遭受词汇偏差的影响,导致性能和泛化能力较差。词汇偏差对理解毒性既有“有用”也有“误导”的影响。不幸的是,当前的去偏方法通常不加区分地消除这些影响,而不是区分它们,导致模型检测精度下降。为此,我们提出了一种反事实因果去偏框架(CCDF)来缓解TLD中的词汇偏差。它保留了词汇偏差的“有用影响”,并消除了“误导影响”。具体来说,我们首先从因果角度表示原始句子和偏差词元对决策的总效应。然后,我们进行反事实推理,从总效应中排除词汇偏差的直接因果效应。实证评估表明,与应用于几个普通模型的竞争基线相比,结合CCDF的去偏TLD模型在准确性和公平性方面均达到了最先进的性能。对于分布外数据,我们模型的泛化能力优于当前的去偏模型。

关键词

引用

@article{arxiv.2406.00983,
  title  = {Take its Essence, Discard its Dross! Debiasing for Toxic Language Detection via Counterfactual Causal Effect},
  author = {Junyu Lu and Bo Xu and Xiaokun Zhang and Kaiyuan Liu and Dongyu Zhang and Liang Yang and Hongfei Lin},
  journal= {arXiv preprint arXiv:2406.00983},
  year   = {2024}
}