二阶RNN的张量分解视角
机器学习
2024-06-10 v1
摘要
二阶递归神经网络(2RNN)通过利用二阶交互进行序列建模来扩展RNN。这些模型在表达能力上被证明优于一阶对应模型,并且与形式语言理论中经过充分研究的模型有联系。然而,它们庞大的参数张量使得计算变得棘手。为了规避这个问题,一种称为MIRNN的方法限制模型使用的交互类型。另一种方法是利用张量分解来减少参数数量。在这项工作中,我们研究了使用CP分解参数化2RNN得到的模型,我们称之为CPRNN。直观上,分解的秩会降低表达能力。我们分析了秩和隐藏大小如何影响模型容量,并展示了基于这些参数的RNN、2RNN、MIRNN和CPRNN之间的关系。我们通过在Penn Treebank数据集上的实验支持了这些结果,实验表明,在固定参数预算下,通过正确选择秩和隐藏大小,CPRNN优于RNN、2RNN和MIRNN。
引用
@article{arxiv.2406.05045,
title = {A Tensor Decomposition Perspective on Second-order RNNs},
author = {Maude Lizaire and Michael Rizvi-Martel and Marawan Gamal Abdel Hameed and Guillaume Rabusseau},
journal= {arXiv preprint arXiv:2406.05045},
year = {2024}
}
备注
Accepted at ICML 2024. Camera ready version