中文

探索 ChatGPT 在 GitHub 毒性检测中的应用

软件工程 2023-12-21 v1

摘要

培育协作和包容的环境对于开源开发的持续进展至关重要。然而,负面言论的普遍存在(通常表现为毒性评论)对开发者的身心健康和生产力构成了重大挑战。为了识别项目交流中的此类负面性,尤其是在大型项目中,需要自动化的毒性检测模型。为了有效训练这些模型,我们需要特定于软件工程的大型毒性数据集。然而,此类数据集可用性有限,且常表现出不平衡(例如,每1000个GitHub issue中仅有6个具有毒性),这为训练有效的毒性检测模型带来了挑战。为了解决这一问题,我们探索了一种零样本LLM(ChatGPT),它在海量数据集上进行了预训练,但未针对检测软件相关文本毒性这一任务进行微调。我们的初步评估表明,ChatGPT在检测GitHub毒性方面显示出前景,值得进一步研究。我们尝试了多种提示,包括那些旨在为模型输出提供依据的提示,从而增强了模型的可解释性,并为将ChatGPT赋能的毒性检测集成到开发者交流渠道中铺平了道路。

关键词

引用

@article{arxiv.2312.13105,
  title  = {Exploring ChatGPT for Toxicity Detection in GitHub},
  author = {Shyamal Mishra and Preetha Chatterjee},
  journal= {arXiv preprint arXiv:2312.13105},
  year   = {2023}
}