Do's and Don'ts:利用指令视频学习期望技能
机器学习
2025-01-24 v2 人工智能
摘要
无监督技能发现是一种旨在无需显式奖励即可获取多样化行为的学习范式。然而,它在学习复杂行为方面面临挑战,并且常常导致学习不安全或不可取的行为。例如,在各种连续控制任务中,当前的无监督技能发现方法成功学习了站立等基本运动,但在学习更复杂的动作(如行走和跑步)时却遇到困难。此外,它们可能学习到不安全的行为(如绊倒和翻滚)或导航到不可取的位置(如陷阱或危险区域)。为此,我们提出了DoDont(Do's and Don'ts),一种基于指令的技能发现算法,由两个阶段组成。首先,在指令学习阶段,DoDont利用无动作指令视频训练一个指令网络,以区分期望的转换与不期望的转换。然后,在技能学习阶段,指令网络调整技能发现算法的奖励函数,以加权期望的行为。具体来说,我们将指令网络集成到一个距离最大化的技能发现算法中,其中指令网络充当距离函数。实验表明,使用少于8个指令视频,DoDont就能在复杂的连续控制任务中有效地学习期望行为并避免不期望的行为。代码和视频可在 https://mynsng.github.io/dodont/ 获取。
引用
@article{arxiv.2406.00324,
title = {Do's and Don'ts: Learning Desirable Skills with Instruction Videos},
author = {Hyunseung Kim and Byungkun Lee and Hojoon Lee and Dongyoon Hwang and Donghu Kim and Jaegul Choo},
journal= {arXiv preprint arXiv:2406.00324},
year = {2025}
}
备注
published at NeurIPS 2024