用于检测 GitHub 议题与 PR 评论中机器人的真值数据集与分类模型
软件工程
2021-01-29 v2 机器学习
摘要
在 GitHub 仓库中,机器人常被用于自动化分布式软件开发流程中的重复性活动。它们通过评论与人类参与者交流。尽管出于多种原因检测其存在十分重要,但目前尚无大规模且具有代表性的真值数据集,也没有基于此类数据集来检测并验证机器人的分类模型。本文提出了一个真值数据集,基于对 5000 个不同 GitHub 账户中拉取请求(pull request)与议题(issue)评论的人工分析(具有高度评分者间一致性),其中 527 个账户被识别为机器人。利用该数据集,我们提出了一种自动化分类模型来检测机器人,其主要特征为每个账户的空评论与非空评论数量、评论模式数量,以及同一评论模式内评论间的不均衡程度。我们在包含 40% 数据的测试集上获得了 0.98 的极高加权平均精确率、召回率与 F1 分数。我们将该分类模型集成到一个开源命令行工具中,使从业者能够检测给定 GitHub 仓库中哪些账户实际对应机器人。
引用
@article{arxiv.2010.03303,
title = {A ground-truth dataset and classification model for detecting bots in GitHub issue and PR comments},
author = {Mehdi Golzadeh and Alexandre Decan and Damien Legay and Tom Mens},
journal= {arXiv preprint arXiv:2010.03303},
year = {2021}
}
备注
16 pages, 11 figures