时间潜在瓶颈:序列学习中快与慢处理机制的融合
机器学习
2022-10-26 v2 人工智能
摘要
循环神经网络对学习时间压缩表示具有强烈的归纳偏置,因为序列的整个历史由单个向量表示。相比之下,Transformer 对学习时间压缩表示几乎没有归纳偏置,因为它们允许对序列中所有先前计算的元素进行注意力。对序列具有更压缩的表示可能有利于泛化,因为高层表示可能更容易被重用和改作他用,并且将包含更少的不相关细节。同时,表示的过度压缩以表达性为代价。我们提出一种将计算划分为两个流的解决方案。本质上是循环的慢流旨在通过强制将 个时间步的块压缩为分为多个向量的单一表示来学习专门且压缩的表示。同时,快流被参数化为 Transformer,以基于慢流中的信息来处理由 个时间步组成的块。在所提出的方法中,我们希望获得 Transformer 的表达性,同时鼓励慢流中更好的压缩与表示结构化。我们展示了所提方法相对于视觉感知与序列决策任务中各种竞争性基线在样本效率与泛化性能方面的优势。
引用
@article{arxiv.2205.14794,
title = {Temporal Latent Bottleneck: Synthesis of Fast and Slow Processing Mechanisms in Sequence Learning},
author = {Aniket Didolkar and Kshitij Gupta and Anirudh Goyal and Nitesh B. Gundavarapu and Alex Lamb and Nan Rosemary Ke and Yoshua Bengio},
journal= {arXiv preprint arXiv:2205.14794},
year = {2022}
}