中文

编程语言代码生成的分类学

材料科学 2026-04-02 v1

摘要

全球约 7,000 多种语言在 NLP 资源可获得性方面差异巨大,这就催生了围绕其资源丰富程度进行系统性分类的努力 (Joshi 等,2020)。类似的差异也存在于编程语言 (PL) 之间,但目前尚未为代码建立资源分层分类学。随着大型语言模型 (LLM) 在生成代码方面的能力日益提升,这种分类学变得至关重要。为填补这一空白,我们提出了首个可复现的 PL 资源分类,将 646 种语言分为四个层级。我们表明,仅 1.9% 的语言 (Tier 3,高) 占据所有七大语料库中 74.6% 的所有 token,而 71.7% 的语言 (Tier 0,稀缺) 仅贡献 1.0% 的 token。关于同一层级内的不平等性、离散程度和分布偏斜的统计分析表明,这种不平衡是极端且系统性的。我们的结果为数据集精选和多语言 LLM 的分层感知评估提供了原则性框架。

关键词

引用

@article{arxiv.2604.00238,
  title  = {Stress Asymmetry in Hard Magnetic Soft Materials},
  author = {H. Gökçen Güner and Francois Barthelat and John D. Clayton and Carlos Mora-Corral and Noel Walkington and Kaushik Dayal},
  journal= {arXiv preprint arXiv:2604.00238},
  year   = {2026}
}