中文

从 Softmax 到 Sparsemax:一种注意力与多标签分类的稀疏模型

计算与语言 2016-02-09 v2 机器学习 机器学习

摘要

我们提出 sparsemax,一种类似于传统 softmax 但能够输出稀疏概率的新激活函数。在推导其性质后,我们展示了如何高效计算其雅可比矩阵(Jacobian),从而使其可用于通过反向传播训练的神经网络。接着,我们提出一种新的平滑且凸的损失函数,它是 logistic 损失的 sparsemax 类比。我们揭示了这一新损失与 Huber 分类损失之间的意外联系。我们在多标签分类问题以及用于自然语言推理的基于注意力的神经网络中获得了有前景的实验结果。对于后者,我们取得了与传统 softmax 相似的性能,但具有选择性更强、更紧凑的注意力聚焦。

关键词

引用

@article{arxiv.1602.02068,
  title  = {From Softmax to Sparsemax: A Sparse Model of Attention and Multi-Label Classification},
  author = {André F. T. Martins and Ramón Fernandez Astudillo},
  journal= {arXiv preprint arXiv:1602.02068},
  year   = {2016}
}

备注

Minor corrections