中文

利用循环折扣注意力单元高效地将注意力应用于序列数据

机器学习 2017-06-20 v2

摘要

循环神经网络架构擅长通过建模不同时间尺度上的依赖关系来处理序列。最近引入的循环加权平均(RWA)单元在若干具有挑战性的任务上捕捉长期依赖的能力远优于 LSTM。RWA 通过对每个输入应用注意力并对其计算的全部历史计算加权平均来实现这一点。遗憾的是,RWA 无法改变其已分配给先前时间步的注意力,因此在执行连续任务或需求变化的任务时存在困难。我们提出了循环折扣注意力(RDA)单元,它在 RWA 的基础上额外允许对过去进行折扣处理。我们在若干具有挑战性的任务上实证比较了我们的模型与 RWA、LSTM 和 GRU 单元。在单输出任务上,RWA、RDA 和 GRU 单元的学习速度远快于 LSTM,且性能更好。在多重序列复制任务上,我们的 RDA 单元学习该任务的速度是 LSTM 或 GRU 单元的三倍,而 RWA 则完全无法学习。在 Wikipedia 字符预测任务上,LSTM 表现最佳,但我们的 RDA 单元紧随其后。总体而言,我们的 RDA 单元在大量多样的序列任务上表现良好且具有样本效率。

关键词

引用

@article{arxiv.1705.08480,
  title  = {Efficiently applying attention to sequential data with the Recurrent Discounted Attention unit},
  author = {Brendan Maginnis and Pierre H. Richemond},
  journal= {arXiv preprint arXiv:1705.08480},
  year   = {2017}
}

备注

Updated results of RDA-exp-tanh unit for the wikipedia char prediction task