中文

自动研究而非调参:对 10,000 项实验的收敛分析

机器学习 2026-03-18 v1 人工智能

摘要

当 LLM 智能体自主设计机器学习实验时,它们是在进行真正的架构搜索,还是在狭窄的设计空间中进行超参数调优?我们通过分析两个 LLM 智能体 (Claude Opus 和 Gemini 2.5 Pro) 在 108,000 个离散单元的组合配置空间中执行的 10,469 项实验来回答这个问题,这些实验是在 27 天内进行的,针对 dashcam 碰撞检测。通过方差分析分解,我们发现**架构选择解释了 94% 的性能方差**(F=1324F = 1324, η2=0.94\eta^2 = 0.94),而在固定架构下的超参数变异仅解释 6%。在第二个碰撞数据集上的跨任务验证确认了这一发现(75% 的架构解释方差),且具有**不同**的获胜主干网络,确认了真正的架构发现。智能体的关键贡献是发现 V-JEPA 2 视频特征与 Zipformer 时间编码器实现 0.9245 AP——这一配置没有人类提出——并将搜索集中在富有成效性的架构区域:在 N=50N = 50 时,LLM 指导的搜索达到 AP =0.985= 0.985,而从零开始的随机搜索为 0.9650.965。事后 bug 修复后的收敛遵循幂律 (c=0.11c = 0.11, R2=0.93R^2 = 0.93);低指数反映了广泛探索的成本,而非效率不足,因为 LLM 发现了比随机或贝叶斯基线的质量更好的区域。我们通过熵循环和 Jensen--Shannon 专化特征来刻画多智能体搜索动力学,提供了第一个针对 LLM 指导组合机器学习实验设计的大规模实证框架。

关键词

引用

@article{arxiv.2603.15916,
  title  = {Auto Researching, not hyperparameter tuning: Convergence Analysis of 10,000 Experiments},
  author = {Xiaoyi Li},
  journal= {arXiv preprint arXiv:2603.15916},
  year   = {2026}
}