基于潜在拓扑映射的零样本模仿学习
机器学习
2026-05-12 v1 人工智能
摘要
模仿学习在专家演示可用时有效训练智能体,但为环境中每个复杂任务收集演示成本较高。我们研究的是长时程、目标条件设置,即固定的演示数据集包含有用行为,但不包含每个智能体必须解决的任务的完整示例。现有的模仿学习方法可以从演示中学习出强策略,但在解决长时程任务时,小误差会在长程原始动作轨迹上累积,导致对新任务的零样本适应不可靠。我们引入基于潜在拓扑的零样本智能体(ZALT),用于解决训练期间未演示的开始-目标任务。ZALT识别轨迹收敛或发散的潜在枢纽状态,学习枢纽间转换的策略和动态模型,并在枢纽拓扑上进行规划以完成新任务。这种拓扑结构使演示行为显式可组合,同时将长期任务压缩为较短的抽象转换序列——综合而言,这使ZALT能够进行零样本适应。在复杂3D迷宫环境中,ZALT在未见任务上实现55%的零样本成功率,而最强基线方法仅为6%。
引用
@article{arxiv.2605.08450,
title = {Zero-shot Imitation Learning by Latent Topology Mapping},
author = {Maxwell J. Jacobson and Yexiang Xue},
journal= {arXiv preprint arXiv:2605.08450},
year = {2026}
}