中文

顶级人工智能会议论文可用源代码的自动分析

软件工程 2022-09-29 v1 人工智能 计算与语言 数字图书馆 机器学习

摘要

源代码对研究者复现人工智能(AI)论文的方法与结果至关重要。一些组织与研究者手动收集带有可用源代码的 AI 论文以贡献于 AI 社区。然而,手动收集是一项劳动密集且耗时的任务。为解决此问题,我们提出一种自动识别带有可用源代码的论文并提取其源代码仓库 URL 的方法。借助该方法,我们发现 2010 至 2019 年发表的 10 个顶级 AI 会议的常规论文中,20.5% 被识别为带有可用源代码的论文,且其中 8.1% 的源代码仓库已无法访问。我们还创建了 XMU NLP Lab README 数据集,这是用于源代码文档研究的最大规模带标注 README 文件数据集。通过该数据集,我们发现相当多的 README 文件未提供安装说明或使用教程。此外,我们对 AI 会议论文源代码的总体状况进行了大规模综合性统计分析。所提出的方案亦可超越 AI 会议论文,用于分析来自期刊与会议的其他科学论文,从而为更多领域提供启示。

关键词

引用

@article{arxiv.2209.14155,
  title  = {Automatic Analysis of Available Source Code of Top Artificial Intelligence Conference Papers},
  author = {Jialiang Lin and Yingmin Wang and Yao Yu and Yu Zhou and Yidong Chen and Xiaodong Shi},
  journal= {arXiv preprint arXiv:2209.14155},
  year   = {2022}
}

备注

Please cite the version of IJSEKE