通过条件转移估计和在线行为对齐实现可泛化的模仿学习
机器学习
2026-01-27 v1 人工智能
摘要
最先进的观察模仿学习 (ILfO) 方法最近取得了显著进展,但它们仍然存在一些局限性:它们需要基于动作的监督优化,假设状态具有单一最优动作,并且倾向于在没有充分考虑实际环境状态的情况下应用教师动作。虽然真相可能存在于观察到的轨迹中,但现有方法难以在没有监督的情况下提取它。在这项工作中,我们提出了无监督观察模仿学习 (UfO),它解决了所有这些局限性。UfO 通过一个两阶段过程学习策略,其中智能体首先在观察到的状态转移中获得教师真实动作的近似值,然后通过调整智能体轨迹使其与教师轨迹紧密对齐来进一步优化学习到的策略。我们在五个广泛使用的环境中进行的实验表明,UfO 不仅优于教师和所有其他 ILfO 方法,而且显示出最小的标准差。这种标准差的减少表明在未见过的场景中具有更好的泛化能力。
引用
@article{arxiv.2601.17563,
title = {Towards Generalisable Imitation Learning Through Conditioned Transition Estimation and Online Behaviour Alignment},
author = {Nathan Gavenski and Matteo Leonetti and Odinaldo Rodrigues},
journal= {arXiv preprint arXiv:2601.17563},
year = {2026}
}
备注
The 25th International Conference on Autonomous Agents and Multi-Agent Systems (AAMAS 2026)