用于大规模参数生成的循环扩散
机器学习
2025-02-12 v2 人工智能
摘要
参数生成长期以来难以匹配当今大型视觉和语言模型的规模,限制了其更广泛的实用性。本文引入了循环扩散大规模参数生成(RPG),一种新型框架,可在单个GPU上生成达数亿参数的完整神经网络参数。我们的方法首先将网络参数划分为不重叠的标记,每种标记对应于模型的不同部分。然后,循环机制学习标记之间的关系,产生原型作为扩散过程的条件,最终合成完整参数。在包括ResNet、ConvNeXt和ViT在内的多种架构和任务上,包括ImageNet 1K和COCO,以及即使是基于LoRA的大语言模型,RPG在性能上与完全训练的网络持平,同时避免了过大的内存开销。值得注意的是,它能够超越训练集,为以前看不到的任务生成有效参数,凸显其在动态和开放式场景中的灵活性。通过克服长期存在的内存和可扩展性障碍,RPG是AI生成AI的关键性进步, potentially 在此前被视为不可行的规模下实现高效权重生成。
引用
@article{arxiv.2501.11587,
title = {Recurrent Diffusion for Large-Scale Parameter Generation},
author = {Kai Wang and Dongwen Tang and Wangbo Zhao and Konstantin Schürholt and Zhangyang Wang and Yang You},
journal= {arXiv preprint arXiv:2501.11587},
year = {2025}
}
备注
Generating 200 million parameters in just minutes