自回归模型的局限性及其替代方案
机器学习
2021-06-01 v3 计算与语言
机器学习
摘要
标准自回归语言模型仅执行多项式时间计算以得出下一符号的概率。尽管这颇具吸引力,但意味着它们无法建模下一符号概率难以计算的分布。事实上,它们甚至无法足够好地建模这些分布以解决相关的简单决策问题——而工程师可能希望借助语言模型来解决这些问题。无论使用多少计算与数据来训练模型,这些局限性都存在,除非模型被赋予随序列长度超多项式增长的预言机参数。因此,简单地训练更大的自回归语言模型并非NLP的万灵药。替代方案包括能量基模型(放弃高效采样)与潜变量自回归模型(放弃对给定字符串的高效打分)。两者都足够强大以规避上述局限。
引用
@article{arxiv.2010.11939,
title = {Limitations of Autoregressive Models and Their Alternatives},
author = {Chu-Cheng Lin and Aaron Jaech and Xin Li and Matthew R. Gormley and Jason Eisner},
journal= {arXiv preprint arXiv:2010.11939},
year = {2021}
}
备注
NAACL 2021 (same content, more relaxed layout)