中文

用于层次注意力网络的剪枝与Sparsemax方法

计算与语言 2020-04-10 v1 机器学习

摘要

本文引入并评估了两种新颖的层次注意力网络模型[Yang et al., 2016]——i)层次剪枝注意力网络,其从分类过程中移除不相关的词和句子,以降低文档分类准确性中的潜在噪声;ii)层次Sparsemax注意力网络,其将注意力机制中使用的Softmax函数替换为Sparsemax[Martins and Astudillo, 2016],能够更好地处理大量词或句子具有极低概率的重要性分布。我们在IMDB评论情感分析数据集上的实证评估表明,两种方法均能与当前最先进方法的结果相匹配(然而并未带来显著收益)。我们的所有源代码均可在https://github.com/jmribeiro/dsl-project获取。

关键词

引用

@article{arxiv.2004.04343,
  title  = {Pruning and Sparsemax Methods for Hierarchical Attention Networks},
  author = {João G. Ribeiro and Frederico S. Felisberto and Isabel C. Neto},
  journal= {arXiv preprint arXiv:2004.04343},
  year   = {2020}
}