用于层次注意力网络的剪枝与Sparsemax方法
计算与语言
2020-04-10 v1 机器学习
摘要
本文引入并评估了两种新颖的层次注意力网络模型[Yang et al., 2016]——i)层次剪枝注意力网络,其从分类过程中移除不相关的词和句子,以降低文档分类准确性中的潜在噪声;ii)层次Sparsemax注意力网络,其将注意力机制中使用的Softmax函数替换为Sparsemax[Martins and Astudillo, 2016],能够更好地处理大量词或句子具有极低概率的重要性分布。我们在IMDB评论情感分析数据集上的实证评估表明,两种方法均能与当前最先进方法的结果相匹配(然而并未带来显著收益)。我们的所有源代码均可在https://github.com/jmribeiro/dsl-project获取。
引用
@article{arxiv.2004.04343,
title = {Pruning and Sparsemax Methods for Hierarchical Attention Networks},
author = {João G. Ribeiro and Frederico S. Felisberto and Isabel C. Neto},
journal= {arXiv preprint arXiv:2004.04343},
year = {2020}
}