中文

“平均”近似“第一主成分”?基于神经语言模型表示的实证分析

计算与语言 2022-02-09 v2 机器学习

摘要

基于神经语言模型的上下文表示推动了各种 NLP 任务的技术水平。尽管取得了巨大成功,此类表示的本质仍是一个谜。在本文中,我们提出了这些表示的一个经验性质——“平均”近似“第一主成分”。具体而言,实验表明,这些表示的平均值与以这些表示为列的矩阵的第一主成分几乎共享同一方向。我们相信这解释了为何平均表示始终是一个简单却强劲的基线。我们进一步的检验表明,该性质在更具挑战性的场景中也成立,例如,当表示来自随机初始化后的模型时。因此,我们推测该性质是表示分布的固有特性,未必与输入结构相关。我们认识到这些表示在每个维度上经验性地服从正态分布,并通过假设其成立,证明了该经验性质事实上可从数学上推导出来。

关键词

引用

@article{arxiv.2104.08673,
  title  = {"Average" Approximates "First Principal Component"? An Empirical Analysis on Representations from Neural Language Models},
  author = {Zihan Wang and Chengyu Dong and Jingbo Shang},
  journal= {arXiv preprint arXiv:2104.08673},
  year   = {2022}
}