中文

多轮 LLM 微调的合成轨迹的双层优化

机器学习 2026-05-26 v1 人工智能

摘要

虽然大语言模型 (LLM) 在单轮生成方面表现出色,但在长期、多轮交互方面存在挑战。离线强化学习 (RL) 提供了一种可扩展的方法,但其性能取决于多轮轨迹数据的可用性和质量。常见的做法是通过 LLM 或模拟器生成合成轨迹来扩充训练数据,但合成数据在质量上高度异构,盲目将所有轨迹视为等信息有时会损害性能。我们提出 BOOST 框架进行双层优化,其中内层优化在重新加权后的数据上训练 LLM,外层优化在 held-out 真实验证任务上训练轻量级重新加权头,在不依赖外部评判器的情况下为轨迹分配连续的轨迹级权重。为此,我们推导了 PAC-Bayesian 上界,揭示了三方面的权衡:合成数据增加了多样性但可能导致任务迁移,而集中于高质量轨迹的加权可提升经验性能但牺牲有效样本量。经实验,我们的方法始终优于多个基线方法。分析表明,我们的方法会提升那些与真实数据分布一致且质量较高的合成轨迹。

关键词

引用

@article{arxiv.2605.24743,
  title  = {Bilevel Optimization of Synthetic Trajectories for Multi-Turn LLM Fine-Tuning},
  author = {Shresth Verma and Mauricio Tec and Cheol Woo Kim and Kai Wang and Milind Tambe},
  journal= {arXiv preprint arXiv:2605.24743},
  year   = {2026}
}