重新思考模仿学习中语言条件技能发现的互信息
机器人学
2024-02-28 v1 人工智能
摘要
语言条件的机器人行为通过将人类命令或指令与感知和行动相关联,在执行复杂任务中发挥着至关重要的作用。基于无约束语言指令组合长视野任务的能力需要获取多样化的通用技能集。然而,在没有外部奖励或人类监督的情况下,在耦合且长视野的环境中获取固有的原始技能面临着重大挑战。在本文中,我们从数学角度评估了技能与语言指令之间的关系,在语言条件策略学习框架内采用了两种形式的互信息。为了以无监督方式最大化语言与技能之间的互信息,我们提出了一种名为语言条件技能发现 (LCSD) 的端到端模仿学习方法。具体而言,我们利用矢量量化来学习离散潜在技能,并利用轨迹的技能序列来重建高层语义指令。通过对包括 BabyAI、LORel 和 CALVIN 在内的语言条件机器人导航和操作任务进行广泛实验,我们证明了我们的方法优于先前的工作。我们的方法表现出更强的针对未见任务的泛化能力、更高的技能可解释性,以及显著更高的任务完成成功率。
引用
@article{arxiv.2402.17511,
title = {Rethinking Mutual Information for Language Conditioned Skill Discovery on Imitation Learning},
author = {Zhaoxun Ju and Chao Yang and Hongbo Wang and Yu Qiao and Fuchun Sun},
journal= {arXiv preprint arXiv:2402.17511},
year = {2024}
}
备注
16 pages