重新思考多层感知器的形状惯例
机器学习
2025-10-03 v1 人工智能
摘要
多层感知器(MLP)通常遵循窄-宽-窄的设计,其中跳连在输入/输出维度上运行,而处理在扩展的隐藏空间中进行。我们通过提出宽-窄-宽(小时glass)MLP 块来挑战这一惯例,其中跳连在扩展维度上运行,而残差计算通过窄瓶颈流动。这种反转利用更高维空间进行增量细化,同时通过参数匹配的设计保持计算效率。实现小时glass MLP 需要将输入信号投影到扩展维度。我们提出,该投影可在随机初始化时固定,不随训练而变化,从而实现高效的训练和推理。我们在流行图像数据集上的生成任务上评估了两种架构,通过系统化的架构搜索描绘了性能-参数 Pareto 前沿。结果表明,小时glass 架构在 Pareto 前沿上 consistently 优于传统设计。随着参数预算的增加,最优小时glass 配置倾向于更深的网络、更宽的跳连和更窄的瓶颈——这是一种与传统 MLP 不同的扩展模式。我们的发现表明,需要重新考虑现代架构中的跳连位置,潜在应用扩展到 Transformer 和其他残差网络。
引用
@article{arxiv.2510.01796,
title = {Rethinking the shape convention of an MLP},
author = {Meng-Hsi Chen and Yu-Ang Lee and Feng-Ting Liao and Da-shan Shiu},
journal= {arXiv preprint arXiv:2510.01796},
year = {2025}
}