中文

Video2Policy: 利用网络视频扩展操作任务中的仿真训练

机器学习 2025-09-30 v4 人工智能

摘要

仿真提供了一种廉价扩大通用策略训练数据的有前景的方法。为了可扩展地生成来自多样且真实任务的数据,现有算法要么依赖可能产生幻觉任务的大型语言模型(LLM),要么依赖数字孪生体,需要精细的真实到仿真对齐且难以扩展。为此,我们引入 Video2Policy,一种新型框架,利用互联网 RGB 视频重建基于日常人类行为的任务。我们的方法包含两个阶段:(1) 基于视频的仿真任务生成;(2) 利用情境 LLM 生成的奖励函数进行强化学习。我们通过在9种不同任务上重建超过100个来自 Something-Something-v2 (SSv2) 数据集的视频,展示了 Video2Policy 的有效性。该方法能够成功训练 RL 策略,包括诸如投掷等复杂且具挑战性的任务。最后,我们表明生成的仿真数据可用于扩大通用策略的训练,并且可通过 Real2Sim2Real 方法传输到真实机器人上。

关键词

引用

@article{arxiv.2502.09885,
  title  = {Comprehensive Review of Neural Differential Equations for Time Series Analysis},
  author = {YongKyung Oh and Seungsu Kam and Jonghun Lee and Dong-Young Lim and Sungil Kim and Alex Bui},
  journal= {arXiv preprint arXiv:2502.09885},
  year   = {2025}
}

备注

Published at the Thirty-Fourth International Joint Conference on Artificial Intelligence (IJCAI 2025), Survey Track. https://www.ijcai.org/proceedings/2025/1179