开源代码评审与问题讨论中的不文明行为检测
软件工程
2023-12-20 v2
摘要
鉴于开源开发的民主性质,代码评审与问题讨论中可能存在不文明现象。不文明行为被定义为讨论中传达不必要不尊重语气的特征,会对开源社区产生负面后果。为防止或尽量减少这些负面后果,开源平台已引入机制以移除讨论中的不文明语言。然而,这类方法需要人工检查,在讨论数量庞大时可能令人不堪重负。为帮助开源社区应对此问题,本文旨在将六种经典机器学习模型与 BERT 进行比较,以检测开源代码评审与问题讨论中的不文明行为。此外,我们评估了添加上下文信息是否能提升模型性能,以及模型在跨平台设置下的表现如何。我们发现 BERT 优于经典机器学习模型,最佳 F1 分数为 0.95。此外,经典机器学习模型在检测非技术与文明讨论时往往表现不佳。我们的结果表明,向 BERT 添加上下文信息并未提升其性能,且所分析的 classifiers 在跨平台设置下均无出色表现。最后,我们提供了关于 classifiers 误分类语气的见解。
引用
@article{arxiv.2206.13429,
title = {Incivility Detection in Open Source Code Review and Issue Discussions},
author = {Isabella Ferreira and Ahlaam Rafiq and Jinghui Cheng},
journal= {arXiv preprint arXiv:2206.13429},
year = {2023}
}
备注
18 pages