Rho-1:并非所有 Token 都是您所需要的
计算与语言
2025-01-09 v4 人工智能
摘要
以往的语言模型预训练方法将下一 token 预测损失统一应用于所有训练 token。我们对此惯例提出挑战,认为并非所有 token 都同等重要。我们的初步分析考察了语言模型的 token 级训练动态,揭示了不同 token 具有截然不同的损失模式。基于这些洞察,我们引入了名为 Rho-1 的新语言模型。传统语言模型学习预测语料库中的每一个下一 token,而 Rho-1 则采用选择性语言建模(Selective Language Modeling, SLM),选择性地在与期望分布对齐的有用 token 上进行训练。该方法使用参考模型对预训练 token 进行评分,然后对得分较高的 token 施加聚焦损失来训练语言模型。在 15B OpenWebMath 语料库上进行持续预训练时,Rho-1 在 9 项数学任务上的少样本准确率获得了高达 30% 的绝对提升。经过微调后,Rho-1-1B 和 7B 在 MATH 数据集上分别取得了 40.6% 和 51.8% 的 SOTA 结果,仅使用 3% 的预训练 token 便匹配了 DeepSeekMath 的表现。此外,在 80B 通用 token 上进行持续预训练时,Rho-1 在 15 项不同任务上平均提升了 6.8%,同时提高了语言模型预训练的效率和性能。
引用
@article{arxiv.2404.07965,
title = {Rho-1: Not All Tokens Are What You Need},
author = {Zhenghao Lin and Zhibin Gou and Yeyun Gong and Xiao Liu and Yelong Shen and Ruochen Xu and Chen Lin and Yujiu Yang and Jian Jiao and Nan Duan and Weizhu Chen},
journal= {arXiv preprint arXiv:2404.07965},
year = {2025}
}
备注
First two authors equal contribution