面向交互式指令跟随智能体的在线持续学习
人工智能
2024-03-14 v2 机器学习
机器人学
摘要
在学习通过语言指令执行日常任务的具身智能体时,文献很大程度上假设智能体在开始时就学习所有训练数据。我们认为这种学习场景不太现实,因为机器人智能体理应在探索和感知世界的过程中持续学习。为了向更现实的具身智能体学习场景迈进一步,我们提出了两种面向具身智能体的持续学习设置:学习新行为(行为增量学习, Behavior-IL)和学习新环境(环境增量学习, Environment-IL)。对于这些任务,先前基于“数据先验”的持续学习方法为过去的任务保留 logits。然而,存储的信息通常是学习不充分的信息,并且需要任务边界信息,而这些信息并不总是可用的。在这里,我们提出在训练期间以移动平均的方式基于置信度分数更新它们,而无需任务边界信息(即无任务),称为置信度感知移动平均 (CAMA)。在提出的 Behavior-IL 和 Environment-IL 设置中,我们简单的 CAMA 在我们的实证验证中以显著优势优于先前的 SOTA。包含代码的项目页面是 https://github.com/snumprlab/cl-alfred。
引用
@article{arxiv.2403.07548,
title = {Online Continual Learning For Interactive Instruction Following Agents},
author = {Byeonghwi Kim and Minhyuk Seo and Jonghyun Choi},
journal= {arXiv preprint arXiv:2403.07548},
year = {2024}
}
备注
ICLR 2024 (Project page: https://bhkim94.github.io/projects/CL-ALFRED)