MotherNet:基于超网络Transformer的快速训练与推理
机器学习
2025-05-12 v2
摘要
基础模型正在变革多种模态的机器学习,上下文学习正取代经典的模型训练。近期关于表格数据的工作暗示了为数值数据分类构建基础模型的类似机遇。然而,现有的元学习方法在推理时间上无法与基于树的方法相竞争。在本文中,我们提出了MotherNet,这是一种在合成分类任务上训练的超网络架构,当以一个从未见过的训练集作为提示时,它通过单次前向传播利用上下文学习生成一个已训练的“子”神经网络的权重。与通常在相对受限的多任务设定下训练的大多数现有超网络不同,MotherNet能够在任意表格数据集上创建多分类模型,而无需任何针对特定数据集的梯度下降。MotherNet生成的子网络在小数据集上优于使用梯度下降训练的神经网络,并且与TabPFN及梯度提升等标准机器学习方法的预测结果相当。与直接应用TabPFN不同,MotherNet生成的网络在推理时具有极高的效率。我们还证明了HyperFast无法在小数据集上执行有效的上下文学习,并严重依赖于针对特定数据集的微调和超参数调优,而MotherNet无需微调或针对每个数据集的超参数。
引用
@article{arxiv.2312.08598,
title = {MotherNet: Fast Training and Inference via Hyper-Network Transformers},
author = {Andreas Müller and Carlo Curino and Raghu Ramakrishnan},
journal= {arXiv preprint arXiv:2312.08598},
year = {2025}
}
备注
17 pages, 13 figures