微调语言表示模型的涌现性质
计算与语言
2019-10-25 v1 机器学习
摘要
大型、自监督的基于 Transformer 的语言表示模型近来受到显著关注,并且仅通过在越来越大的语料上扩展预训练,便在各类任务上取得了最先进的结果。此类模型通常产生高维向量,在其上添加额外的任务特定层与架构修改以适配特定的下游任务。尽管存在充分证据表明此类模型表现良好,我们旨在理解其在表现良好时发生了什么。我们分析了这样一个语言表示模型——BERT——的输出向量中所含信息的冗余度与位置。我们给出了经验证据:BERT 中的 [CLS] 嵌入含有高度冗余的信息,并且可被压缩而精度损失极小,尤其对于微调模型而言,这与领域中有关过参数化在学习中作用的开放线索相契合。我们也阐明了特定输出维度的存在性,这些维度单独使用即可与采用输出向量全部维度相比给出极具竞争力的结果。
引用
@article{arxiv.1910.10832,
title = {Emergent Properties of Finetuned Language Representation Models},
author = {Alexandre Matton and Luke de Oliveira},
journal= {arXiv preprint arXiv:1910.10832},
year = {2019}
}
备注
7 pages