中文

基于潜在表示的行为克隆:通过视频实现样本高效监督

机器学习 2025-12-29 v1

摘要

人类能够仅通过少量试错从视频中高效提取知识并学习技能。然而,要为自主智能体复制这一学习过程面临诸多挑战,包括视觉输入的复杂性、缺乏动作或奖励信号,以及交互步骤的限制。本文提出一种新型、无监督且样本高效的框架,用于实现从视频的行为克隆(ILV),称为基于潜在表示的行为克隆(BCV-LR)。BCV-LR通过自监督任务从高维视频输入中提取与动作相关的潜在特征,然后利用基于动态的无监督目标预测连续帧之间的潜在动作。预训练的潜在动作随后在收集的交互数据上进行精细调优,并高效地对齐到真实动作空间,以实现策略行为克隆。克隆的策略反过来丰富了智能体的经验,进而进行进一步的潜在动作微调,形成高度样本高效的迭代策略改进。我们在一组具有挑战性的视觉任务上进行了广泛实验,包括离散控制和连续控制。BCV-LR能够以仅需少量交互实现有效(甚至在某些任务上达到专家水平)的策略性能,相较于现有ILV基线和强化学习方法(提供环境奖励),在24/28个任务中实现了更高的样本效率。据我们所知,本工作首次展示了视频如何能够支持极其样本高效的视觉策略学习,无需访问其他专家监督信号。

关键词

引用

@article{arxiv.2512.21586,
  title  = {Videos are Sample-Efficient Supervisions: Behavior Cloning from Videos via Latent Representations},
  author = {Xin Liu and Haoran Li and Dongbin Zhao},
  journal= {arXiv preprint arXiv:2512.21586},
  year   = {2025}
}