中文

将标记视为数据点:面向更大规模语言模型的通用性界限

机器学习 2024-07-26 v1 机器学习

摘要

大规模语言模型 (LLM) 以数十亿参数在序列中预测下一个标记方面表现出色。最近的工作计算了 LLM 的非空压缩基通用性界限,但这些界限在以十亿计参数规模的模型上仍然是空的。此外,这些界限是通过限制性压缩技术获得的,对压缩后的模型进行界定,这些模型生成的文本质量较低。此外,这些现有界限的紧致程度取决于训练集中 IID 文档的数量,而不是远多于非 IID 组成标记的数量,留下了获得更紧致界限的潜力。本文则利用鞅的性质来推导通用性界限,这些界限从 LLM 训练集中广泛可用的标记数目中受益。由于数据集所含的标记远多于文档,我们的通用性界限不仅容忍,而且实际上受益于更不限制性的压缩方案。使用 Monarch 矩阵、Kronecker 分解和后训练量化,我们实现了针对 LLaMA2-70B 等大型模型的非空通用性界限。与以前的方法不同,我们实现了首个针对实际部署且生成高质量文本的模型的非空界限。

关键词

引用

@article{arxiv.2407.18158,
  title  = {Unlocking Tokens as Data Points for Generalization Bounds on Larger Language Models},
  author = {Sanae Lotfi and Yilun Kuang and Brandon Amos and Micah Goldblum and Marc Finzi and Andrew Gordon Wilson},
  journal= {arXiv preprint arXiv:2407.18158},
  year   = {2024}
}