中文

利用概念激活向量提升隐式滥用语言检测的泛化能力

计算与语言 2022-04-06 v1 机器学习

摘要

机器学习模型在不断变化的真实世界数据上的鲁棒性至关重要,尤其对于影响人类福祉的应用如内容审核。新型滥用语言随着当前事件(如 COVID-19)在在线讨论中持续涌现,已部署的滥用检测系统需定期更新以保持准确。本文表明,通用滥用语言分类器在检测域外显式滥用语句上相当可靠,却无法检测更微妙、隐式的新型滥用。接着,我们提出一种基于计算机视觉中测试概念激活向量(TCAV)方法的可解释性技术,量化训练模型对人类定义的显式与隐式滥用语言概念的敏感度,并用以解释模型在新数据(本例中为 COVID 相关反亚裔仇恨言论)上的泛化性。扩展该技术,我们引入一种针对单个实例的新度量——显式程度,并表明该新度量有益于推荐域外无标签样本,从而以信息丰富的隐式滥用文本有效丰富训练数据。

关键词

引用

@article{arxiv.2204.02261,
  title  = {Improving Generalizability in Implicitly Abusive Language Detection with Concept Activation Vectors},
  author = {Isar Nejadgholi and Kathleen C. Fraser and Svetlana Kiritchenko},
  journal= {arXiv preprint arXiv:2204.02261},
  year   = {2022}
}

备注

accepted to be published at ACL2022