基于混合策略子轨迹平衡的高效优化器学习
机器学习
2025-11-04 v1 计算机视觉与模式识别
机器学习
摘要
近期的生成式建模进展使得神经网络能够在不依赖梯度优化的情况下生成权重。然而,当前方法受限于过度耦合和长轨迹问题。前者将权重生成严格绑定于任务特定目标,限制了所学优化器的灵活性;后者导致推理过程效率低下且精度不高,因缺乏局部约束。本文提出 Lo-Hp,一种解耦的两阶段权重生成框架,通过学习各种优化策略来提升灵活性。它采用混合策略子轨迹平衡目标,整合基于策略的学习与离策略学习,以捕获局部优化策略。理论上,我们证明仅学习局部优化策略可解决长轨迹问题,同时提升全局最优权重的生成。在此基础上,我们验证了 Lo-Hp 在需要频繁权重更新的任务(如迁移学习、少样本学习、域泛化和大语言模型适应)中的卓越精度和推理效率。
引用
@article{arxiv.2511.00543,
title = {Learning an Efficient Optimizer via Hybrid-Policy Sub-Trajectory Balance},
author = {Yunchuan Guan and Yu Liu and Ke Zhou and Hui Li and Sen Jia and Zhiqi Shen and Ziyang Wang and Xinglin Zhang and Tao Chen and Jenq-Neng Hwang and Lei Li},
journal= {arXiv preprint arXiv:2511.00543},
year = {2025}
}