中文

ToxCCIn:具可解释性的有毒内容分类

计算与语言 2021-03-03 v1

摘要

尽管基于 transformer 的模型近期在多种任务的有效性上取得进展,其决策对人类而言往往仍不透明。对于社交媒体上的攻击性语言或毒性检测等任务,解释尤为重要,因为通常设有人工申诉流程以对自动标记的内容提出异议。在本工作中,我们提出一种提升此类模型可解释性的技术,基于一个简单而有力的假设:一篇帖子的毒性至少与其最具毒性的片段一样高。我们将该假设通过基于帖子各片段最大毒性打分并增强训练过程以识别正确片段的方式,整合进 transformer 模型。根据一项人工研究,我们发现该方法有效,并能产生质量超过 Logistic Regression 分析(常被视为高度可解释模型)所提供解释的解释。

关键词

引用

@article{arxiv.2103.01328,
  title  = {ToxCCIn: Toxic Content Classification with Interpretability},
  author = {Tong Xiang and Sean MacAvaney and Eugene Yang and Nazli Goharian},
  journal= {arXiv preprint arXiv:2103.01328},
  year   = {2021}
}

备注

Long paper accepted to WASSA2021@EACL