通过掩码Transformer解耦文本表示
计算与语言
2021-09-14 v2 机器学习
摘要
来自 BERT 等大型预训练模型的表示将多种特征编码进整体向量中,从而在众多下游任务上具备强劲的预测精度。本文探讨是否可通过在预训练模型内部识别编码不同且互补方面表示的现有子网络来学习解耦表示。具体而言,我们在 transformer 权重或隐藏单元上学习二值掩码,以揭示与特定变异因素相关的特征子集;这免去了为特定任务从零训练解耦模型的需要。我们在将情感与电影评论体裁、推文中的“毒性”与方言、以及句法与语义解耦的能力上评估该方法。通过将掩码与幅度剪枝相结合,我们发现在 BERT 中可识别出强烈编码特定方面(如毒性)而仅弱编码其他方面(如种族)的稀疏子网络。此外,尽管仅学习掩码,我们发现基于掩码的解耦表现与先前基于变分自编码器和对抗训练的方法相当——且往往更优。
引用
@article{arxiv.2104.07155,
title = {Disentangling Representations of Text by Masking Transformers},
author = {Xiongyi Zhang and Jan-Willem van de Meent and Byron C. Wallace},
journal= {arXiv preprint arXiv:2104.07155},
year = {2021}
}
备注
14 pages, 9 figures