论自监督 Transformer 中的分离归一化
计算与语言
2023-11-30 v2 人工智能
机器学习
摘要
Transformer 的自监督训练方法已在多个领域展现出卓越性能。此前的基于 Transformer 的模型,如掩码自编码器(MAE),通常对 [CLS] 符号与令牌使用单一归一化层。我们在本文中提出一种简单修改,即对令牌与 [CLS] 符号采用分离归一化层,以更好地捕捉其各自特征并提升下游任务表现。我们的方法旨在缓解对两类令牌使用相同归一化统计量可能带来的负面效应,该效应或与其各自角色并非最优对齐。我们通过经验表明,利用分离归一化层,[CLS] 嵌入能更好地编码全局上下文信息,并在其各向异性空间中分布更均匀。当以两个分离层替换常规归一化层时,我们观察到在图像、自然语言与图领域上平均 2.7% 的性能提升。
引用
@article{arxiv.2309.12931,
title = {On Separate Normalization in Self-supervised Transformers},
author = {Xiaohui Chen and Yinkai Wang and Yuanqi Du and Soha Hassoun and Li-Ping Liu},
journal= {arXiv preprint arXiv:2309.12931},
year = {2023}
}
备注
NIPS 2023