OAT-Rephrase:面向零阶优化大语言模型微调的优化感知训练数据重述
机器学习
2025-06-24 v1 人工智能
摘要
使用零阶优化(ZO)对大语言模型(LLM)进行微调是梯度方法的一种内存更高效的替代方案,但由于噪声梯度估计的影响,收敛速度较慢且优化不稳定。这篇论文介绍了OAT-Rephrase,这是一种优化感知训练数据重述策略,利用LLM根据其对ZO动态(特别是MeZO)的理解来重述训练实例。该方法包含一个双阶段管道,由重述LLM和语义判官器组成,确保所有重述都保留任务相关性和逻辑一致性。跨越五个分类任务和三个LLM架构的评估表明,OAT-Rephrase在MeZO微调性能上 consistently 提升,常常缩小甚至消除与一阶方法之间的差距。我们的发现表明,优化感知的重述是一种可重复且低开销的零阶调优 regime 的增强措施。
引用
@article{arxiv.2506.17264,
title = {OAT-Rephrase: Optimization-Aware Training Data Rephrasing for Zeroth-Order LLM Fine-Tuning},
author = {Jikai Long and Zijian Hu and Xiaodong Yu and Jianwen Xie and Zhaozhuo Xu},
journal= {arXiv preprint arXiv:2506.17264},
year = {2025}
}