中文

利用 ToxiCR 自动识别有毒代码评审

软件工程 2023-02-09 v3 计算与语言 机器学习

摘要

软件开发交互中的有毒对话可能对自由开源软件(FOSS)开发项目产生严重影响。例如,有毒对话的受害者可能变得不敢表达自己,从而失去动力,并可能最终离开项目。有毒对话的自动过滤可帮助 FOSS 社区维持成员间的健康交互。然而,现成的毒性检测器在软件工程(SE)数据集(如从代码评审评论中整理的数据集)上表现不佳。为应对此挑战,我们提出 ToxiCR,一种基于监督学习的代码评审交互毒性识别工具。ToxiCR 包含选择十种监督学习算法之一的选项、文本向量化技术的选项、八个预处理步骤,以及包含 19,571 条代码评审评论的大规模标注数据集。这八个预处理步骤中有两个是 SE 领域特定的。通过对具有各种预处理步骤与向量化技术组合的模型进行严格评估,我们确定了数据集的最佳组合,其准确率达 95.8%、F1 分数为 88.9%。ToxiCR 在我们的数据集上显著优于现有毒性检测器。我们已公开发布数据集、预训练模型、评估结果和源代码:https://github.com/WSU-SEAL/ToxiCR

关键词

引用

@article{arxiv.2202.13056,
  title  = {Automated Identification of Toxic Code Reviews Using ToxiCR},
  author = {Jaydeb Sarker and Asif Kamal Turzo and Ming Dong and Amiangshu Bosu},
  journal= {arXiv preprint arXiv:2202.13056},
  year   = {2023}
}