中文

ANDHRA Bandersnatch:训练预测平行现实的神经网络

计算机视觉与模式识别 2024-12-02 v1

摘要

受许多世界解释(MWI)启发,本工作引入了一种新颖的神经网络架构,该架构在每一层将相同的输入信号分割为多个平行分支,利用称为ANDHRA的超整流激活函数。分支层不会合并,形成独立的网络路径,导致多个网络头用于输出预测。在分支因子为2的三个层级上,总头数为2^3=8。各个头通过组合其各自的损失值进行联合训练。然而,该架构在训练时由于额外的分支需要额外的参数和内存。在推理阶段,实验结果在CIFAR-10/100上表明,存在一个独立的头能够超过基线准确率,在参数和计算成本相等的情况下实现统计显著的改进。

关键词

引用

@article{arxiv.2411.19213,
  title  = {ANDHRA Bandersnatch: Training Neural Networks to Predict Parallel Realities},
  author = {Venkata Satya Sai Ajay Daliparthi},
  journal= {arXiv preprint arXiv:2411.19213},
  year   = {2024}
}

备注

New World!