论神经算法推理的马尔可夫性质:分析与方法
机器学习
2024-03-11 v1 人工智能
神经与进化计算
摘要
神经算法推理是一个新兴的研究方向,旨在赋予神经网络逐步模仿算法执行的能力。现有设计中的一个常见范式涉及使用历史嵌入来预测未来执行步骤的结果。我们在本工作中的观察是,这种历史依赖性在本质上与算法推理任务的马尔可夫性质相矛盾。基于这一动机,我们提出了 ForgetNet,它不使用历史嵌入,因此与任务的马尔可夫性质一致。为了解决 ForgetNet 在早期训练阶段的挑战,我们进一步引入了 G-ForgetNet,它使用门控机制允许选择性集成历史嵌入。这种增强的能力在模型早期训练阶段提供了有价值的计算路径。我们基于 CLRS-30 算法推理基准的大量实验表明,ForgetNet 和 G-ForgetNet 都比现有方法实现了更好的泛化能力。此外,我们调查了门控机制的行为,强调了其与我们要直觉的一致程度及其对鲁棒性能的有效性。
引用
@article{arxiv.2403.04929,
title = {On the Markov Property of Neural Algorithmic Reasoning: Analyses and Methods},
author = {Montgomery Bohde and Meng Liu and Alexandra Saxton and Shuiwang Ji},
journal= {arXiv preprint arXiv:2403.04929},
year = {2024}
}
备注
To appear at ICLR 2024 (Spotlight paper). 17 pages, 10 figures