语言模型中的规则外推:关于稀疏提示下组合泛化的研究
计算与语言
2024-10-25 v2 机器学习
机器学习
摘要
语言模型展现出类似推断概念的突出能力,这种能力被称为基于情境学习。尽管这种成功常被归因于Transformer架构,但我们对其系统性理解仍有限。在复杂的真实数据集中,甚至定义稀疏性都并非明显。在更好地理解自回归语言模型的稀疏行为方面,我们关注形式语言,这些语言由规则的交集定义。我们定义了一种新的稀疏组合泛化场景,称为规则外推。规则外推描述了稀疏情景,其中提示违反至少一条规则。我们在线性和循环架构中评估规则外推的形式语言,包括Transformer和状态空间模型,以理解架构对规则外推的影响。我们还受算法信息论中Solomonoff先验启发,为规则外推奠定了规范理论的第一步。
引用
@article{arxiv.2409.13728,
title = {Rule Extrapolation in Language Models: A Study of Compositional Generalization on OOD Prompts},
author = {Anna Mészáros and Szilvia Ujváry and Wieland Brendel and Patrik Reizinger and Ferenc Huszár},
journal= {arXiv preprint arXiv:2409.13728},
year = {2024}
}
备注
Accepted as a spotlight poster at NeurIPS2024