递归中的递归:用于长度泛化与可扩展性的两级嵌套递归
摘要
二叉平衡树递归神经网络(BBT-RvNNs)按照预设的平衡二叉树结构强制进行序列组合。因此,其非线性递归深度仅为 ( 为序列长度)。这种对数级缩放使得 BBT-RvNNs 在长程竞技场(LRA)等长序列任务上高效且可扩展。然而,这种计算效率是有代价的,因为 BBT-RvNNs 无法解决诸如 ListOps 之类的简单算术任务。另一方面,确实能在 ListOps(以及形式逻辑推理等其他结构敏感任务)上取得成功的 RvNNs(例如 Beam Tree RvNN)通常比甚至 RNNs 还要昂贵数倍。在本文中,我们引入了一种新颖的框架——递归中的递归(RIR),以在两者之间取得平衡,即从两个世界中各取部分优势。在 RIR 中,我们采用一种两级嵌套递归形式——其中外层递归是一个 元平衡树模型,其单元函数由另一个递归模型(内层递归)实现。对于内层递归,我们选择 Beam Tree RvNNs(BT-RvNN)。为了在 RIR 中调整 BT-RvNNs,我们还提出了一种新颖的束对齐策略。总体而言,这意味着 RIR 中的总递归深度上界为 。我们基于 RIR 的最佳模型是首个在 ListOps 上展示出高()长度泛化性能,同时可扩展性足以在来自 LRA 的长序列输入上训练的模型。此外,在 LRA 语言任务的准确率方面,它在无任何特殊初始化的情况下与结构化状态空间模型(SSMs)具有竞争力——大幅优于 Transformers。另一方面,虽然 SSMs 在 LRA 上能略微优于 RIR,但它们(SSMs)无法在 ListOps 上实现长度泛化。我们的代码可在:\url{https://github.com/JRC1995/BeamRecursionFamily/} 获取。
引用
@article{arxiv.2311.04449,
title = {Recursion in Recursion: Two-Level Nested Recursion for Length Generalization with Scalability},
author = {Jishnu Ray Chowdhury and Cornelia Caragea},
journal= {arXiv preprint arXiv:2311.04449},
year = {2023}
}
备注
Accepted at NeurIPS 2023