学习通过全局工作空间路由信息以链接操作
机器学习
2025-03-10 v2 人工智能
计算机视觉与模式识别
神经元与认知
摘要
我们提出了一个受全局工作空间理论启发的模型,该模型集成了专用模块以执行序列推理任务。控制器通过使用门控机制在工作空间内的模块间选择性地路由信息。这种方法允许模型通过在专门领域之间迭代地广播信息来链接操作,从而模仿 System-2 推理。我们在一个简单的加法任务上评估了模型的性能,该任务需要将两个加数求和。该任务可以通过将信息依次通过输入模块、递增模块(多次)以及最后的输出模块进行路由来解决。我们考虑了该系统的两种复杂度递增的实现。首先,使用在独热数字表示上操作的手工设计模块,控制器(一个 LSTM 循环网络)学习按适当的顺序选择适当的模块(输入、递增、输出)。其次,我们用针对 MNIST 图像的学习表示模块和在任务目标上训练的递增模块替换了手工设计模块;在这里,控制器同样学习到了适当的序列模块选择以解决任务。最后,我们表明,全局工作空间模型在测试未见过的加法操作(包括训练期间所见加法操作的插值和外推)时,尽管参数较少,但其性能优于 LSTM 和 Transformer。我们的结果突显了受全局工作空间理论启发的架构在增强深度学习推理能力方面的潜力。
引用
@article{arxiv.2503.01906,
title = {Learning to Chain Operations by Routing Information Through a Global Workspace},
author = {Hugo Chateau-Laurent and Rufin VanRullen},
journal= {arXiv preprint arXiv:2503.01906},
year = {2025}
}
备注
12 pages, 14 figures, submitted to a conference