软件工程交互中当代毒性检测器的基准研究
软件工程
2020-09-22 v1
摘要
自动过滤有毒对话可帮助开源软件(OSS)社区维护项目参与者之间的健康互动。尽管已有若干通用工具用于识别有毒内容,但它们可能错误地将软件工程(SE)语境中常用的某些词(如'junk'、'kill'和'dump')标记为有毒,反之亦然。为应对这一挑战,CMU Strudel 实验室提出了一个 SE 专用工具(以下简称'STRUDEL'),其将 Perspective API 的输出与斯坦福礼貌检测工具定制版本的输出相结合。然而,由于 STRUDEL 的评估仅基于 654 条 SE 文本,其实用性尚不明确。因此,本研究旨在大规模 SE 数据集上实证评估 Strudel 工具以及四种最先进的通用毒性检测器。为此,我们实证开发了一套用于人工标注有毒 SE 交互的准则。使用该准则,我们人工标注了 6,533 条代码审查评论和 4,140 条 Gitter 消息的数据集。分析结果表明,所有工具在我们的数据集上性能均显著下降。与 Gitter 消息等非正式沟通数据集相比,在代码审查等正式 SE 沟通数据集上的性能下降幅度显著更高。在我们用 SE 数据集重新训练后,研究中两个模型在 10 折交叉验证中表现出显著性能提升。基于对有错误分类文本的人工考察,我们提出了若干用于开发 SE 专用毒性检测器的建议。
引用
@article{arxiv.2009.09331,
title = {A Benchmark Study of the Contemporary Toxicity Detectors on Software Engineering Interactions},
author = {Jaydeb Sarker and Asif Kamal Turzo and Amiangshu Bosu},
journal= {arXiv preprint arXiv:2009.09331},
year = {2020}
}