面向指令遵循任务的基于目标条件强化学习的自我引导计划提取
人工智能
2026-04-23 v1 计算与语言
摘要
我们引入了 SuperIgor,一个用于指令遵循任务的框架。与依赖预定义子任务的先前方法不同,SuperIgor 使语言模型能够通过自我学习机制生成和优化高层计划,从而减少了对人工数据集标注的需求。我们的方法涉及迭代协同训练:一个强化学习(RL)智能体被训练以遵循生成的计划,而语言模型则根据 RL 反馈和偏好来调整和修改这些计划。这创建了一个反馈循环,其中智能体和规划器共同改进。我们在具有丰富动态和随机性的环境中验证了我们的框架。结果表明,SuperIgor 智能体比基线方法更严格地遵循指令,同时对未见过的指令也表现出强大的泛化能力。
引用
@article{arxiv.2604.20601,
title = {Self-Guided Plan Extraction for Instruction-Following Tasks with Goal-Conditional Reinforcement Learning},
author = {Zoya Volovikova and Nikita Sorokin and Dmitriy Lukashevskiy and Aleksandr Panov and Alexey Skrynnik},
journal= {arXiv preprint arXiv:2604.20601},
year = {2026}
}