通过子群体分析理解语言模型中的领域学习
计算与语言
2022-10-25 v1 机器学习
摘要
我们研究不同领域如何编码于现代神经网络架构中。我们分析了自然语言领域、模型规模与所用训练数据量之间的关系。我们开发的主要分析工具基于带奇异向量典型相关分析(SVCCA)的子群体分析,并将其应用于基于 Transformer 的语言模型(LMs)。我们比较这样一对模型中语言模型不同层的潜在表示:一个在多个领域上训练的模型(实验模型)与一个在单一领域上训练的模型(控制模型)。通过我们的方法,我们发现增大模型容量对领域信息在上层与下层中的存储方式影响不同。此外,我们展示更大的实验模型同时嵌入领域特定信息,如同它们是拼接的控制模型。这些发现经定性确认,证明了我们方法的有效性。
引用
@article{arxiv.2210.12553,
title = {Understanding Domain Learning in Language Models Through Subpopulation Analysis},
author = {Zheng Zhao and Yftah Ziser and Shay B. Cohen},
journal= {arXiv preprint arXiv:2210.12553},
year = {2022}
}
备注
Accepted to BlackboxNLP 2022