Paloma:评估语言模型拟合度的基准
计算与语言
2024-12-10 v2 人工智能
机器学习
摘要
对语言模型(LM)的评估通常会报告在从训练中留出的单一数据上的困惑度。隐式或显式地,这些数据由多个领域——即不同的语言分布——组成。我们引入了用于语言模型评估的困惑度分析(Paloma),这是一个用于衡量LM对546个英语和代码领域拟合度的基准,而不是假设在一个分布上的困惑度可以外推到其他分布。我们包含了两个新数据集,分别涵盖前100个子版块(例如Reddit上的r/depression)和编程语言(例如GitHub上的Java),这两者都是当代LM的常见来源。伴随我们的基准,我们发布了6个经过精心控制的10亿参数基线LM,以提供关于哪种预训练语料库最好的公平比较,并发布了供他人将这些控制应用于其自身实验的代码。我们的案例研究展示了Paloma的细粒度结果如何揭示某些发现,例如,仅在Common Crawl之外无数据预训练的模型在许多领域的LM拟合度上表现出异常差距,或者损失主要由词汇表中最常出现的字符串主导。
引用
@article{arxiv.2312.10523,
title = {Paloma: A Benchmark for Evaluating Language Model Fit},
author = {Ian Magnusson and Akshita Bhagia and Valentin Hofmann and Luca Soldaini and Ananya Harsh Jha and Oyvind Tafjord and Dustin Schwenk and Evan Pete Walsh and Yanai Elazar and Kyle Lo and Dirk Groeneveld and Iz Beltagy and Hannaneh Hajishirzi and Noah A. Smith and Kyle Richardson and Jesse Dodge},
journal= {arXiv preprint arXiv:2312.10523},
year = {2024}
}
备注
Conference: NeurIPS 2024, Project Page: https://paloma.allen.ai/