中文

评估模型规模对语义解析中组合泛化的影响

计算与语言 2022-10-26 v2

摘要

尽管预训练语言模型在许多任务上表现强劲,但已有研究表明其在分布外组合泛化上存在困难。与此同时,近期工作显示模型缩放可显著改善许多 NLP 任务。扩大模型规模是否也能改善语义解析中的组合泛化?我们评估了参数量达 11B 的编码器-解码器模型和参数量达 540B 的解码器-only 模型,并比较了将预训练语言模型应用于新任务的三种不同方法的模型缩放曲线:全参数微调、提示微调(prompt tuning)和上下文学习(in-context learning)。我们观察到,在语义解析评估的分布外组合泛化上,微调通常具有平坦或负的缩放曲线。上下文学习具有正的缩放曲线,但通常被小得多的微调模型超越。提示微调可以优于微调,因其展现出更正的缩放曲线,表明通过缩放还有进一步改进潜力。此外,我们识别出若干随模型规模变化的错误趋势。例如,更大的模型通常更擅长建模输出空间的句法,但也更容易出现某些类型的过拟合。总体而言,我们的研究揭示了当前技术有效利用模型规模实现组合泛化的局限性,同时我们的分析也指出了未来工作的有前景方向。

关键词

引用

@article{arxiv.2205.12253,
  title  = {Evaluating the Impact of Model Scale for Compositional Generalization in Semantic Parsing},
  author = {Linlu Qiu and Peter Shaw and Panupong Pasupat and Tianze Shi and Jonathan Herzig and Emily Pitler and Fei Sha and Kristina Toutanova},
  journal= {arXiv preprint arXiv:2205.12253},
  year   = {2022}
}

备注

EMNLP 2022