中文

ManyTypes4Py:一个用于基于机器学习的类型推断的 Python 基准数据集

软件工程 2021-04-13 v1 机器学习 编程语言

摘要

在本文中,我们提出 ManyTypes4Py,一个用于基于机器学习(ML)的类型推断的大型 Python 数据集。该数据集包含总计 5,382 个 Python 项目,具有超过 869K 个类型标注。我们移除了重复源代码文件,以消除重复偏差的负面影响。为便于 ML 模型的训练与评估,该数据集按文件划分为训练集、验证集和测试集。为从抽象语法树(AST)中提取类型信息,我们开发了一个轻量级静态分析器流水线,并随数据集一同提供。利用该流水线,对所收集的 Python 项目进行了分析,并将 AST 分析结果存储于 JSON 格式文件中。ManyTypes4Py 数据集已在 zenodo 上共享,其工具在 GitHub 上公开可用。

关键词

引用

@article{arxiv.2104.04706,
  title  = {ManyTypes4Py: A Benchmark Python Dataset for Machine Learning-based Type Inference},
  author = {Amir M. Mir and Evaldas Latoskinas and Georgios Gousios},
  journal= {arXiv preprint arXiv:2104.04706},
  year   = {2021}
}

备注

MSR'21, Data Showcase To download the dataset, check out its GitHub repo: https://github.com/saltudelft/many-types-4-py-dataset