ToxiSpanSE:代码评审评论中可解释的有毒内容检测
软件工程
2023-07-10 v1
摘要
背景:开源平台中存在有毒对话会恶化软件开发者之间的关系,并可能对软件产品质量产生负面影响。为缓解此问题,已有一些初步工作用于检测软件工程(SE)领域中的有毒评论。目的:由于自动将整段文本分类为有毒或无毒并不能帮助人工审核者理解毒性的具体原因,我们致力于为SE领域开发可解释的有毒检测器。方法:我们的可解释有毒检测器能够从SE文本中检测有毒内容的具体片段,从而通过自动高亮这些片段来辅助人工审核者。该有毒片段检测模型ToxiSpanSE使用带有有毒片段标注的19,651条代码评审(CR)评论进行训练。我们的标注者对3,757个有毒CR样本中的有毒片段进行了标注。我们探索了多种模型,包括一种基于词典的方法与五种不同基于transformer的编码器。结果:在对所有模型进行广泛评估后,我们发现微调的RoBERTa模型取得了最佳得分,对有毒类词元的为0.88、精确率为0.87、召回率为0.93,为SE领域提供了可解释的有毒分类器。结论:由于ToxiSpanSE是SE领域首个检测有毒片段的工具,该工具将为应对SE社区中的毒性开辟道路。
引用
@article{arxiv.2307.03386,
title = {ToxiSpanSE: An Explainable Toxicity Detection in Code Review Comments},
author = {Jaydeb Saker and Sayma Sultana and Steven R. Wilson and Amiangshu Bosu},
journal= {arXiv preprint arXiv:2307.03386},
year = {2023}
}