中文

通过能力感知目标采样从演示中学习

人工智能 2026-01-14 v1

摘要

尽管前景广阔,但模仿学习在长周期环境中常常失败,因为完美复制演示是不切实际的,且小错误可能会灾难性地累积。我们提出了 Cago(Capability-Aware Goal Sampling,能力感知目标采样),一种从演示中学习的新方法,以减轻对专家轨迹直接模仿的脆弱依赖。与先前仅在策略初始化或奖励塑造中使用演示的方法不同,Cago 沿专家轨迹动态跟踪智能体的能力,并利用该信号选择中间步骤——即刚好超出智能体当前可达范围的目标——来指导学习。这产生了一种自适应课程,使智能体能够稳步推进以解决完整任务。实验结果表明,在一系列稀疏奖励、目标条件任务中,Cago 显著提高了样本效率和最终性能,始终优于现有的从演示中学习基线。

关键词

引用

@article{arxiv.2601.08731,
  title  = {Learning from Demonstrations via Capability-Aware Goal Sampling},
  author = {Yuanlin Duan and Yuning Wang and Wenjie Qiu and He Zhu},
  journal= {arXiv preprint arXiv:2601.08731},
  year   = {2026}
}

备注

39th Conference on Neural Information Processing Systems (NeurIPS 2025)