梯度:当市场遇上微调——面向模型优化的分布式方法
人工智能
2025-09-04 v2 机器学习
摘要
当前 AutoML 平台未能发挥出充分的性能。我们在参数规模从 70M 到 70B 的模型上测试了 180 个微调任务,发现 HuggingFace AutoTrain、TogetherAI、Databricks 和 Google Cloud 一致产生次优配置。Gradients 基于 Bittensor 网络,通过竞争来攻击这一问题。独立的矿工赛跑寻找最优超参数,按其模型性能比例获取奖励。这种锦标赛驱动探索那些单一策略方法永远不会检验的配置空间。在我们的实验中,Gradients 对 TogetherAI、Databricks 和 Google Cloud 以 100% 的获胜率,仅在 82.8% 的实验中战胜 HuggingFace AutoTrain。平均改进幅度达到 42.1%。检索增强生成任务实现 30-40% 的提升;扩散模型在人物特定生成方面提升 23.4%。当矿工为奖励而竞争时,他们会发展出中心化方法所忽视的优化策略。这些发现表明,具有经济激励的去中心化系统可系统性地超越传统 AutoML,表明市场动态可能是实现卓越微调结果的关键。代码地址:https://github.com/rayonlabs/G.O.D.
引用
@article{arxiv.2506.07940,
title = {Gradients: When Markets Meet Fine-tuning -- A Distributed Approach to Model Optimisation},
author = {Christopher Subia-Waud},
journal= {arXiv preprint arXiv:2506.07940},
year = {2025}
}