中文

二阶RNN的张量分解视角

机器学习 2024-06-10 v1

摘要

二阶递归神经网络(2RNN)通过利用二阶交互进行序列建模来扩展RNN。这些模型在表达能力上被证明优于一阶对应模型,并且与形式语言理论中经过充分研究的模型有联系。然而,它们庞大的参数张量使得计算变得棘手。为了规避这个问题,一种称为MIRNN的方法限制模型使用的交互类型。另一种方法是利用张量分解来减少参数数量。在这项工作中,我们研究了使用CP分解参数化2RNN得到的模型,我们称之为CPRNN。直观上,分解的秩会降低表达能力。我们分析了秩和隐藏大小如何影响模型容量,并展示了基于这些参数的RNN、2RNN、MIRNN和CPRNN之间的关系。我们通过在Penn Treebank数据集上的实验支持了这些结果,实验表明,在固定参数预算下,通过正确选择秩和隐藏大小,CPRNN优于RNN、2RNN和MIRNN。

关键词

引用

@article{arxiv.2406.05045,
  title  = {A Tensor Decomposition Perspective on Second-order RNNs},
  author = {Maude Lizaire and Michael Rizvi-Martel and Marawan Gamal Abdel Hameed and Guillaume Rabusseau},
  journal= {arXiv preprint arXiv:2406.05045},
  year   = {2024}
}

备注

Accepted at ICML 2024. Camera ready version