顶级人工智能会议论文可用源代码的自动分析
软件工程
2022-09-29 v1 人工智能
计算与语言
数字图书馆
机器学习
摘要
源代码对研究者复现人工智能(AI)论文的方法与结果至关重要。一些组织与研究者手动收集带有可用源代码的 AI 论文以贡献于 AI 社区。然而,手动收集是一项劳动密集且耗时的任务。为解决此问题,我们提出一种自动识别带有可用源代码的论文并提取其源代码仓库 URL 的方法。借助该方法,我们发现 2010 至 2019 年发表的 10 个顶级 AI 会议的常规论文中,20.5% 被识别为带有可用源代码的论文,且其中 8.1% 的源代码仓库已无法访问。我们还创建了 XMU NLP Lab README 数据集,这是用于源代码文档研究的最大规模带标注 README 文件数据集。通过该数据集,我们发现相当多的 README 文件未提供安装说明或使用教程。此外,我们对 AI 会议论文源代码的总体状况进行了大规模综合性统计分析。所提出的方案亦可超越 AI 会议论文,用于分析来自期刊与会议的其他科学论文,从而为更多领域提供启示。
引用
@article{arxiv.2209.14155,
title = {Automatic Analysis of Available Source Code of Top Artificial Intelligence Conference Papers},
author = {Jialiang Lin and Yingmin Wang and Yao Yu and Yu Zhou and Yidong Chen and Xiaodong Shi},
journal= {arXiv preprint arXiv:2209.14155},
year = {2022}
}
备注
Please cite the version of IJSEKE