立场:大语言模型最昂贵的部分应该是其训练数据
计算与语言
2025-04-18 v1 人工智能
计算机与社会
机器学习
摘要
由于不断增长的算力、硬件、能源和工程需求,训练最先进的大语言模型(LLM)是一项日益昂贵的事业。然而,一个经常被忽视(且很少得到报酬)的开销是这些模型训练数据背后的人工劳动。每个 LLM 都建立在难以估量的人力之上:数万亿精心编写的词汇来源于书籍、学术论文、代码库、社交媒体等。本立场论文旨在为这种劳动分配货币价值,并主张生产 LLM 最昂贵的部分应该是向训练数据生产者为其工作提供的报酬。为了支持这一立场,我们研究了 2016 年至 2024 年间发布的 64 个 LLM,估算如果让人从头开始生成其训练数据集需要支付多少成本。即使在极其保守的工资率估计下,这些模型训练数据集的成本也是训练模型本身成本的 10 到 1000 倍,这对 LLM 提供商构成了重大的财务责任。面对训练数据价值与其创建缺乏补偿之间的巨大差距,我们强调并讨论了未来能够实现更公平实践的研究方向。
引用
@article{arxiv.2504.12427,
title = {Position: The Most Expensive Part of an LLM should be its Training Data},
author = {Nikhil Kandpal and Colin Raffel},
journal= {arXiv preprint arXiv:2504.12427},
year = {2025}
}
备注
8 pages, 3 figures