中文

基于熵的注意力正则化摆脱列表依赖的无意偏置缓解

计算与语言 2022-03-18 v1

摘要

自然语言处理(NLP)模型存在过拟合训练数据中特定术语的风险,从而降低其性能、公平性与泛化能力。例如,神经仇恨言论检测模型受同性恋、女性等身份术语的强烈影响,导致假阳性、严重的无意偏置以及更低的性能。多数缓解技术在训练时使用身份术语列表或目标域样本。然而,该方法需要先验知识,且若遗漏重要术语会引入进一步偏置。对此,我们提出一种无知识的基于熵的注意力正则化(EAR)以抑制对训练特定术语的过拟合。一个附加目标函数惩罚具有低自注意力熵的 token。我们通过 EAR 微调 BERT:所得模型在英语与意大利语的三个基准语料库上达到或超越仇恨言论分类及偏置指标的当前最优性能。EAR 还揭示了过拟合术语,即最可能引发偏置的术语,以帮助识别其对模型、任务与预测的影响。

关键词

引用

@article{arxiv.2203.09192,
  title  = {Entropy-based Attention Regularization Frees Unintended Bias Mitigation from Lists},
  author = {Giuseppe Attanasio and Debora Nozza and Dirk Hovy and Elena Baralis},
  journal= {arXiv preprint arXiv:2203.09192},
  year   = {2022}
}

备注

Accepted to Findings of ACL 2022