中文

把索引排齐:面向真实世界的大语言模型训练数据的全文检索

计算与语言 2025-10-13 v1

摘要

大语言模型(LLM)的性能取决于其训练数据。尽管开源权重的 LLM 不断涌现,但对 LLM 训练数据的访问仍然有限。即使对于完全开源的 LLM,数据的规模也使其对整个科学界而言几乎不可解读,尽管其中可能包含从互联网抓取的关键数据。在本文中,我们展示了 Apertus LLM 训练数据的全文索引流水线。借助 Elasticsearch 的并行索引以及 Alps 基础设施(一种先进的、高能效的 arm64 超级集群),我们成功索引了用于训练 Apertus LLM 系列的 15.2 万亿词元中的 8.6 万亿词元,既构建了一个关键的 LLM 安全工具,也实质上打造了一个离线、经过整理的开放网络搜索引擎。我们的贡献体现在三个方面。首先,我们证明 Elasticsearch 可以成功移植到下一代基于 arm64 的基础设施上。其次,我们证明在现代 LLM 训练数据集乃至整个开放网络的规模上进行全文索引是可行且可及的。最后,我们证明此类索引可用于确保此前难以实现的、与越狱方式无关的 LLM 安全。我们希望我们的发现对其他尝试大规模数据索引的团队有所裨益,并促进向更绿色计算的普遍过渡。

关键词

引用

@article{arxiv.2510.09471,
  title  = {Getting Your Indices in a Row: Full-Text Search for LLM Training Data for Real World},
  author = {Ines Altemir Marinas and Anastasiia Kucherenko and Alexander Sternfeld and Andrei Kucharavy},
  journal= {arXiv preprint arXiv:2510.09471},
  year   = {2025}
}