利用均值-最大值注意力自编码器学习通用句子表示
计算与语言
2018-09-19 v1
摘要
为了学习通用句子表示,以往方法聚焦于复杂的循环神经网络或监督学习。本文中,我们在编码器-解码器框架内提出一种均值-最大值注意力自编码器(mean-max AAE)。我们的自编码器完全依赖 MultiHead 自注意力机制来重建输入序列。在编码中,我们提出一种均值-最大值策略,对隐藏向量同时施加均值和最大值池化操作以捕获输入的多样信息。为使信息能动态引导重建过程,解码器对均值-最大值表示执行注意力。通过在大规模无标签数据上训练我们的模型,我们获得了高质量的句子表示。在广泛的 10 项迁移任务上的实验结果表明,我们的模型优于最先进的(SOTA)无监督单一方法,包括经典的 skip-thoughts 和先进的 skip-thoughts+LN 模型。此外,相较于传统循环神经网络,我们的均值-最大值 AAE 大幅减少了训练时间。
引用
@article{arxiv.1809.06590,
title = {Learning Universal Sentence Representations with Mean-Max Attention Autoencoder},
author = {Minghua Zhang and Yunfang Wu and Weikang Li and Wei Li},
journal= {arXiv preprint arXiv:1809.06590},
year = {2018}
}
备注
EMNLP 2018