中文

ToxVis:通过交互式可视化实现隐性与显性毒性检测模型的可解释性

计算与语言 2023-03-17 v1 人机交互

摘要

在线平台上仇恨言论的兴起导致对有效内容审核的迫切需求。然而,仇恨在线内容的主观且多面性(包括隐性仇恨言论)给人工审核员与内容审核系统带来重大挑战。为解决此问题,我们开发了 ToxVis,一种视觉交互且可解释的将仇恨言论分类为三类——隐性、显性与非仇恨——的工具。我们使用 RoBERTa、XLNET 与 GPT-3 微调了两个基于 transformer 的模型,并运用深度学习解释技术为分类结果提供解释。ToxVis 使用户能输入潜在仇恨文本并接收分类结果及关于哪些词对决策贡献最大的视觉解释。通过使分类过程可解释,ToxVis 为理解仇恨内容的细微差别并支撑更有效的内容审核提供了宝贵工具。我们的研究有助于日益增多的旨在减轻在线仇恨言论危害的工作,并展示了将最先进自然语言处理模型与可解释深度学习技术结合以应对此关键问题的潜力。最后,ToxVis 可成为内容审核员、社交媒体平台及致力于打击在线仇恨言论传播的研究者的资源。

关键词

引用

@article{arxiv.2303.09402,
  title  = {ToxVis: Enabling Interpretability of Implicit vs. Explicit Toxicity Detection Models with Interactive Visualization},
  author = {Uma Gunturi and Xiaohan Ding and Eugenia H. Rho},
  journal= {arXiv preprint arXiv:2303.09402},
  year   = {2023}
}

备注

3 pages, 1 figures