通过分析与合成基准序列数据集中的长距离依赖理解循环神经架构
机器学习
2020-12-09 v4 机器学习
摘要
为了构建高效的深度循环神经架构,分析所建模数据集的长距离依赖(LDDs)的复杂性至关重要。本文中,我们给出了对各种数据集所展现的依赖衰减曲线的详细分析。从相似过程(例如自然语言、序列 MNIST、严格 k-分段语言等)中采样的数据集在依赖衰减曲线的性质上表现出差异。我们的分析揭示了导致这些差异的因素;如(i)数据集中唯一符号的数量,(ii)数据集的大小,(iii)给定 LDD 内相互作用的符号数,以及(iv)相互作用符号之间的距离。我们通过生成严格 k-分段语言的合成数据集来检验这些因素。这些合成数据集的另一个优势是能够对深度循环神经架构按其建模具有不同特征的 LDDs 的能力进行针对性测试。我们还证明,分析依赖衰减曲线有助于为 SOTA 深度循环神经架构选择最优超参数。该分析可直接促进更准确高效的序列模型的发展。
引用
@article{arxiv.1810.02966,
title = {Understanding Recurrent Neural Architectures by Analyzing and Synthesizing Long Distance Dependencies in Benchmark Sequential Datasets},
author = {Abhijit Mahalunkar and John D. Kelleher},
journal= {arXiv preprint arXiv:1810.02966},
year = {2020}
}