中文

稀疏序列到序列模型

计算与语言 2019-06-14 v2 机器学习

摘要

序列到序列模型是 NLP 的有力主力。多数变体在其注意力机制与输出层均采用 softmax 变换,导致稠密对齐与严格为正的输出概率。这种稠密是浪费的,使模型可解释性降低,并将概率质量分配给许多不可能的输出。本文提出稀疏序列到序列模型,根植于新的 α\alpha-entmax 变换族,其包含 softmax 与 sparsemax 作为特例,且对任意 α>1\alpha > 1 是稀疏的。我们提供快速算法来评估这些变换及其梯度,可良好扩展至大词表规模。我们的模型能产生稀疏对齐,并将非零概率分配给短列表中的合理输出,有时使集束搜索精确。在形态屈折与机器翻译上的实验显示相较稠密模型的一致增益。

关键词

引用

@article{arxiv.1905.05702,
  title  = {Sparse Sequence-to-Sequence Models},
  author = {Ben Peters and Vlad Niculae and André F. T. Martins},
  journal= {arXiv preprint arXiv:1905.05702},
  year   = {2019}
}

备注

ACL 2019 Camera Ready