无控制的词汇暴露导致预训练模型组合泛化能力的高估
计算与语言
2022-12-22 v1
摘要
人类语言能力常以组合性及其所实现的泛化来刻画——人类学习者可通过组合已知部分来生成与理解新颖复杂表达。若干基准利用训练与测试间的分布控制来度量组合泛化,其中某些词汇项在训练期间仅出现于有限语境。尽管近期基于这些基准的工作表明预训练模型取得了令人印象深刻的泛化性能,我们主张预训练数据的暴露可能破坏上述分布控制。利用Kim与Linzen(2020)的COGS基准,我们测试了两种控制此问题的改进评估设定:(1)将语境受控词汇项替换为新颖字符序列,(2)将其替换为由新颖嵌入表示的特殊token。我们发现这两种设定均导致T5(Raffel等,2020)的泛化性能下降,表明先前报告的结果因预训练期间无控制词汇暴露而被高估。使用新颖嵌入时性能退化更剧烈,且退化随预训练数据量增加而加剧,凸显了一个有趣的反向缩放案例。
引用
@article{arxiv.2212.10769,
title = {Uncontrolled Lexical Exposure Leads to Overestimation of Compositional Generalization in Pretrained Models},
author = {Najoung Kim and Tal Linzen and Paul Smolensky},
journal= {arXiv preprint arXiv:2212.10769},
year = {2022}
}
备注
Preprint