中文

基于自监督标签视频的集成无监督策略克隆

计算机视觉与模式识别 2025-04-09 v2 人工智能

摘要

当前先进的策略学习方法在提供足够信息时能够开发出专业水平的策略。然而,这些方法对任务特定奖励、带动作标签的专家轨迹以及大量环境交互的要求在许多场景下昂贵甚至不可获得。相比之下,人类可以在缺乏其他监督的情况下,通过仿照容易获得的网络视频,在少量试错中高效地获取技能。本文提出了 UPESV (Unsupervised Policy from Ensemble Self-supervised labeled Videos),一个新型框架,通过从无动作标签的视频中高效学习策略。UPESV 训练视频标注模型,通过几个有机组合的自监督任务推断专家动作。每个任务履行其职责,两者共同使模型充分利用无动作视频和无奖励交互,以实现稳健的动态理解和高级动作预测。同时,UPESV 从标注后的专家视频中克隆策略,进而收集环境交互以进行自监督任务。经过高效、无监督且迭代的训练过程,UPESV 基于稳健的视频标注模型获得了先进的策略。基于三个公开数据集的全面实验表明,所提出的 UPESV 在不依赖任何其他监督信息的情况下,以卓越的交互受限策略学习性能实现了突破(在 12/16 个任务中超越了五个当前先进的基线方法)。

关键词

引用

@article{arxiv.2412.10778,
  title  = {Sample-efficient Unsupervised Policy Cloning from Ensemble Self-supervised Labeled Videos},
  author = {Xin Liu and Yaran Chen and Haoran Li},
  journal= {arXiv preprint arXiv:2412.10778},
  year   = {2025}
}

备注

ICRA 2025, 8 pages