中文

在测试集上预训练即所需的一切

计算与语言 2023-09-19 v1 人工智能

摘要

受近期工作展示基于 Transformer 的小型语言模型在精心筛选数据上预训练的潜力启发,我们通过大力策划一种仅基于评估基准的新型、高质量、非合成数据混合,来强化此类方法。使用我们由少于十万词元组成的新型数据集混合,我们预训练了一个百万参数的基于 Transformer 的 LLM \textbf{phi-CTNL}(发音为“fictional”),其在多样化学术基准上取得完美结果,严格优于所有已知基础模型。\textbf{phi-CTNL} 也打破了幂律缩放,并展现出前所未见的类顿悟(grokking)能力,可准确预测下游评估基准的陷阱样本(canaries)。

关键词

引用

@article{arxiv.2309.08632,
  title  = {Pretraining on the Test Set Is All You Need},
  author = {Rylan Schaeffer},
  journal= {arXiv preprint arXiv:2309.08632},
  year   = {2023}
}

备注

3 pages, satire