中文

基于无标签演示视频的开放世界技能发现

计算机视觉与模式识别 2025-09-03 v2 人工智能

摘要

在开放世界环境中学习技能对于开发能够通过组合基础技能来处理各种任务的智能体至关重要。通常情况下,线上演示视频时长较长且未被分割,难以进行技能分割和标注。与依赖序列抽样或人工标注的现有方法不同,本文 developed a一种基于自监督学习的方法,用于将这些长视频分割为一系列语义感知且技能一致的片段。我们受人类认知事件分割理论的启发,引入技能边界检测(SBD),这是一种无需注释的时序视频分割算法。SBD通过利用预训练的无条件动作预测模型的预测误差来检测视频中的技能边界。该方法基于以下假设:显著的预测误差增大表明正在执行的技能发生了变化。我们在Minecraft——一个拥有大量游戏视频可供训练的丰富开放世界模拟器中进行了评估。我们的SBD生成的分割结果在短期原子技能任务上提高了63.7%和52.1%的平均性能,在对应层次化智能体上提高了11.3%和20.8%的长期任务性能。该方法可利用多样化的YouTube视频训练遵循指令的智能体。项目页面可在 https://craftjarvis.github.io/SkillDiscovery 查找。

关键词

引用

@article{arxiv.2503.10684,
  title  = {Open-World Skill Discovery from Unsegmented Demonstrations},
  author = {Jingwen Deng and Zihao Wang and Shaofei Cai and Anji Liu and Yitao Liang},
  journal= {arXiv preprint arXiv:2503.10684},
  year   = {2025}
}

备注

Accepted by ICCV 2025