中文

解决粒度不匹配:面向长期LLM代理的层次化偏好学习

机器学习 2026-03-03 v2 人工智能

摘要

大型语言模型(Large Language Models, LLMs)作为自主代理人正越来越多地被赋予解决复杂、长期问题的任务。通过基于偏好的离线方法(如直接偏好优化,Direct Preference Optimization, DPO)来对齐这些代理人是一个值得期待的方向,但面临一个关键的粒度不匹配问题。轨迹级DPO提供的信号过于粗糙,难以进行精确的信任分配,而步骤级DPO往往过于片刻,难以捕捉多步骤行为的价值。为解决此挑战,我们引入层次化偏好学习(Hierarchical Preference Learning, HPL),这是一个利用多种协同粒度的偏好信号来优化LLM代理人的层次化框架。虽然HPL整合了轨迹级和步骤级DPO以实现全局和局部策略的稳定性,但其核心创新在于受双层课程驱动的组级偏好优化。我们的 метод首先将专家轨迹分解为语义连贯的动作组,然后生成对比的次优组,以实现针对细粒度子任务水平的偏好学习。然后,HPL引入课程调度器,将学习过程从简单到复杂地组织起来。该课程沿两个轴向结构化:组长度代表子任务的复杂性,样本难度定义为首选动作组与不良选动作组之间的奖励差距。针对三个具有挑战性的代理基准进行实验,表明HPL超过了现有最先进的方法。我们的分析表明,层次化DPO损失有效地整合了跨多个粒度的偏好信号,而双层课程对于使代理人能够解决从简单行为到复杂多步骤序列的广泛任务至关重要。

关键词

引用

@article{arxiv.2510.03253,
  title  = {Solving the Granularity Mismatch: Hierarchical Preference Learning for Long-Horizon LLM Agents},
  author = {Heyang Gao and Zexu Sun and Erxue Min and Hengyi Cai and Shuaiqiang Wang and Dawei Yin and Xu Chen},
  journal= {arXiv preprint arXiv:2510.03253},
  year   = {2026}
}

备注

Accepted to ICLR 2026