中文

自回归模型的局限性及其替代方案

机器学习 2021-06-01 v3 计算与语言 机器学习

摘要

标准自回归语言模型仅执行多项式时间计算以得出下一符号的概率。尽管这颇具吸引力,但意味着它们无法建模下一符号概率难以计算的分布。事实上,它们甚至无法足够好地建模这些分布以解决相关的简单决策问题——而工程师可能希望借助语言模型来解决这些问题。无论使用多少计算与数据来训练模型,这些局限性都存在,除非模型被赋予随序列长度超多项式增长的预言机参数。因此,简单地训练更大的自回归语言模型并非NLP的万灵药。替代方案包括能量基模型(放弃高效采样)与潜变量自回归模型(放弃对给定字符串的高效打分)。两者都足够强大以规避上述局限。

关键词

引用

@article{arxiv.2010.11939,
  title  = {Limitations of Autoregressive Models and Their Alternatives},
  author = {Chu-Cheng Lin and Aaron Jaech and Xin Li and Matthew R. Gormley and Jason Eisner},
  journal= {arXiv preprint arXiv:2010.11939},
  year   = {2021}
}

备注

NAACL 2021 (same content, more relaxed layout)