稀疏序列到序列模型
计算与语言
2019-06-14 v2 机器学习
摘要
序列到序列模型是 NLP 的有力主力。多数变体在其注意力机制与输出层均采用 softmax 变换,导致稠密对齐与严格为正的输出概率。这种稠密是浪费的,使模型可解释性降低,并将概率质量分配给许多不可能的输出。本文提出稀疏序列到序列模型,根植于新的 -entmax 变换族,其包含 softmax 与 sparsemax 作为特例,且对任意 是稀疏的。我们提供快速算法来评估这些变换及其梯度,可良好扩展至大词表规模。我们的模型能产生稀疏对齐,并将非零概率分配给短列表中的合理输出,有时使集束搜索精确。在形态屈折与机器翻译上的实验显示相较稠密模型的一致增益。
引用
@article{arxiv.1905.05702,
title = {Sparse Sequence-to-Sequence Models},
author = {Ben Peters and Vlad Niculae and André F. T. Martins},
journal= {arXiv preprint arXiv:1905.05702},
year = {2019}
}
备注
ACL 2019 Camera Ready