中文

利用均值-最大值注意力自编码器学习通用句子表示

计算与语言 2018-09-19 v1

摘要

为了学习通用句子表示,以往方法聚焦于复杂的循环神经网络或监督学习。本文中,我们在编码器-解码器框架内提出一种均值-最大值注意力自编码器(mean-max AAE)。我们的自编码器完全依赖 MultiHead 自注意力机制来重建输入序列。在编码中,我们提出一种均值-最大值策略,对隐藏向量同时施加均值和最大值池化操作以捕获输入的多样信息。为使信息能动态引导重建过程,解码器对均值-最大值表示执行注意力。通过在大规模无标签数据上训练我们的模型,我们获得了高质量的句子表示。在广泛的 10 项迁移任务上的实验结果表明,我们的模型优于最先进的(SOTA)无监督单一方法,包括经典的 skip-thoughts 和先进的 skip-thoughts+LN 模型。此外,相较于传统循环神经网络,我们的均值-最大值 AAE 大幅减少了训练时间。

关键词

引用

@article{arxiv.1809.06590,
  title  = {Learning Universal Sentence Representations with Mean-Max Attention Autoencoder},
  author = {Minghua Zhang and Yunfang Wu and Weikang Li and Wei Li},
  journal= {arXiv preprint arXiv:1809.06590},
  year   = {2018}
}

备注

EMNLP 2018