中文

通过大型语言模型进行开放式指令重标注来学习指令遵循策略

机器学习 2025-06-26 v1 计算与语言

摘要

在强化学习中开发有效的指令遵循策略仍然具有挑战性,这源于对大量人工标注指令数据集的依赖以及从稀疏奖励中学习的困难。在本文中,我们提出了一种新颖的方法,利用大型语言模型(LLMs)的能力,从先前收集的智能体轨迹中回顾性地自动生成开放式指令。我们的核心思想是使用LLMs对不成功的轨迹进行重标注,通过识别智能体已隐式完成的有意义的子任务,从而丰富智能体的训练数据,并大幅减轻对人类标注的依赖。通过这种开放式指令重标注,我们有效地学习到一个统一的指令遵循策略,能够在单个策略内处理多样化的任务。我们在具有挑战性的Craftax环境中对我们的方法进行了实证评估,证明了与最先进的基线相比,在样本效率、指令覆盖率和整体策略性能方面都有显著提升。我们的结果突显了利用LLM引导的开放式指令重标注来增强指令遵循强化学习的有效性。

关键词

引用

@article{arxiv.2506.20061,
  title  = {Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models},
  author = {Zhicheng Zhang and Ziyan Wang and Yali Du and Fei Fang},
  journal= {arXiv preprint arXiv:2506.20061},
  year   = {2025}
}

备注

Under Review