对抗性目标推断下的一致性零样态模仿
机器学习
2025-10-21 v1
摘要
就像生成式模型今天大部分在自监督方式下进行训练一样,agentic模型如何在自监督方式下进行训练,交互式地探索、学习并准备好快速适应新任务?部署在真实世界交互中的具身智能体应以交互方式进行训练,但当今最成功的AI模型(如视觉语言模型、大语言模型)是在没有明确动作概念的训练方式。纯粹的探索问题(假设没有数据输入)在强化学习文献中已广泛研究,为智能体提供广泛的经验,但无法为快速适应新任务做好准备。今天的语言和视觉模型是在人类提供的数据上训练的,这为模型将要解决的任务类型(例如在小调中建模和弦,在诗句中建模短语,在医学记录中建模句子)提供了强大的归纳偏置。然而,当它们被提示解决新任务时,就存在将人类大部分时间花在最有奖励状态的faulty tacit assumption。我们论文的关键贡献是一种方法,用于以自监督方式预训练交互式智能体,以便即时模仿人类演示。我们的方法将目标(即观察)视为原子构造。在训练期间,我们的方法自动提出目标并练习到达它们,基于强化学习探索的先前工作。在评估期间,我们的方法解决一个(摊销)逆强化学习问题,以解释演示作为最优目标到达行为。在标准基准测试(未为目标到达设计)上的实验表明,我们的方法在零样态模仿方面超越了先前方法。
引用
@article{arxiv.2510.17059,
title = {Consistent Zero-Shot Imitation with Contrastive Goal Inference},
author = {Kathryn Wantlin and Chongyi Zheng and Benjamin Eysenbach},
journal= {arXiv preprint arXiv:2510.17059},
year = {2025}
}