LaMDAgent:基于 LLM 智能体的训练后流水线优化自主框架
计算与语言
2025-05-29 v1 人工智能
摘要
大语言模型在广泛的任务中展现出了卓越的性能。为了进一步将 LLM 定制到特定领域或应用,通常会采用监督微调(SFT)、偏好学习和模型合并等训练后技术。虽然这些方法各自已被广泛独立研究,但完整训练后流水线的自动构建仍是一个未被充分探索的领域。现有方法通常依赖手动设计或仅狭隘地优化单个组件,如数据排序或合并策略。在这项工作中,我们引入了 LaMDAgent(Language Model Developing Agent 的缩写),一个通过使用基于 LLM 的智能体自主构建和优化完整训练后流水线的新颖框架。LaMDAgent 系统地探索各种模型生成技术、数据集和超参数配置,利用基于任务的反馈来发现高性能流水线,同时将人工干预降至最低。我们的实验表明,LaMDAgent 将工具使用准确率提高了 9.0 个百分点,同时保持了指令遵循能力。此外,它发现了通常被传统人类驱动探索所忽略的有效训练后策略。我们进一步分析了数据和模型规模缩放对减少探索计算成本的影响,发现模型规模缩放带来了新的挑战,而数据规模缩放则实现了成本效益高的流水线发现。
引用
@article{arxiv.2505.21963,
title = {LaMDAgent: An Autonomous Framework for Post-Training Pipeline Optimization via LLM Agents},
author = {Taro Yano and Yoichi Ishibashi and Masafumi Oyamada},
journal= {arXiv preprint arXiv:2505.21963},
year = {2025}
}