中文

HuggingGraph:理解LLM生态系统的供应链

计算与语言 2025-09-08 v3 人工智能

摘要

大型语言模型(LLM)利用深度学习架构来处理和预测单词序列,使它们能够执行广泛的自然语言处理任务,例如翻译、摘要、问答和内容生成。由于现有的LLM通常基于基础模型或其他预训练模型构建,并使用外部数据集,它们不可避免地会继承先前模型或数据集中存在的漏洞、偏见或恶意组件。因此,理解这些组件的来源和开发过程对于检测潜在风险、提高模型公平性以及确保符合监管框架至关重要。受此启发,本项目旨在研究模型和数据集之间的这种关系,这是LLM供应链的核心部分。首先,我们设计了一种系统性地收集LLM供应链信息的方法。然后,我们设计了一个新的图来建模模型和数据集之间的关系,这是一个有向异构图,包含402,654个节点和462,524条边。最后,我们进行了不同类型的分析并得出了多个有趣的发现。

关键词

引用

@article{arxiv.2507.14240,
  title  = {HuggingGraph: Understanding the Supply Chain of LLM Ecosystem},
  author = {Mohammad Shahedur Rahman and Peng Gao and Yuede Ji},
  journal= {arXiv preprint arXiv:2507.14240},
  year   = {2025}
}