中文

Zoology: 衡量和改进高效语言模型中的回忆能力

计算与语言 2023-12-11 v1 机器学习

摘要

结合门控和卷积的无注意力语言模型因其高效性和日益增长的竞争性能而越来越受欢迎。为了更好地理解这些架构,我们预训练了一组17个注意力和“门控卷积”语言模型,发现最先进的门控卷积架构在Pile上的困惑度仍比注意力模型差多达2.1个点。在细粒度分析中,我们发现82%的差距可以通过每个模型回忆先前在上下文中提及的信息的能力来解释,例如“Hakuna Matata means no worries Hakuna Matata it means no” → “??”。在这个称为“关联回忆”的任务上,我们发现注意力模型大幅优于门控卷积:一个70M参数的注意力模型在关联回忆上优于一个1.4B参数的门控卷积模型。这令人惊讶,因为先前的工作表明门控卷积可以完美解决AR能力的合成测试。为了弥合合成测试和真实语言之间的差距,我们开发了一个称为多查询关联回忆(MQAR)的新任务形式化,更好地反映实际语言。我们对MQAR进行了实证和理论研究,阐明了注意力和门控卷积回忆在参数效率上的差异。根据我们的分析,我们评估了简单的卷积-注意力混合模型,并表明具有输入相关稀疏注意力模式的混合模型可以弥合与注意力之间97.4%的差距,同时保持次二次缩放。我们的代码可在https://github.com/HazyResearch/zoology获取。

关键词

引用

@article{arxiv.2312.04927,
  title  = {Zoology: Measuring and Improving Recall in Efficient Language Models},
  author = {Simran Arora and Sabri Eyuboglu and Aman Timalsina and Isys Johnson and Michael Poli and James Zou and Atri Rudra and Christopher Ré},
  journal= {arXiv preprint arXiv:2312.04927},
  year   = {2023}
}