中文

通过CycleQD实现大型语言模型的智能体技能习得

计算与语言 2025-02-18 v4 人工智能 神经与进化计算

摘要

训练大型语言模型以获取特定技能仍然是一项艰巨的挑战。传统的训练方法常常难以应对数据分布不平衡以及目标函数与任务特定性能不匹配的问题。为了解决这些挑战,我们引入了CycleQD,这是一种新颖的方法,它通过算法的循环自适应利用质量多样性框架,并结合了基于模型合并的交叉和基于奇异值分解的变异。在CycleQD中,每个任务的性能指标被交替作为质量度量,而其他指标则作为行为特征。这种对单个任务的循环关注允许一次集中精力于一个任务,消除了数据比例调整的需要,并简化了目标函数的设计。来自AgentBench的实证结果表明,将CycleQD应用于基于LLAMA3-8B-INSTRUCT的模型,不仅使其在编码、操作系统和数据库任务上超越了传统的微调方法,而且在这些领域达到了与可能包含更多参数的GPT-3.5-TURBO相当的性能。至关重要的是,这种增强的性能是在保持强大语言能力的同时实现的,其在广泛采用的语言基准任务上的表现证明了这一点。我们强调了CycleQD中的关键设计选择,详细说明了这些选择如何促进其有效性。此外,我们的方法是通用的,可以应用于图像分割模型,突出了其在不同领域的适用性。

关键词

引用

@article{arxiv.2410.14735,
  title  = {Agent Skill Acquisition for Large Language Models via CycleQD},
  author = {So Kuroki and Taishi Nakamura and Takuya Akiba and Yujin Tang},
  journal= {arXiv preprint arXiv:2410.14735},
  year   = {2025}
}

备注

To appear at the 13th International Conference on Learning Representations (ICLR 2025)