中文

面向通用机器人从互联网视频中学习的通用方法:综述

机器人学 2025-07-24 v5 机器学习

摘要

规模化的深度学习已在诸如视频生成和自然语言处理等领域取得显著突破。然而,机器人学习尚未实现这一成功,仍受数据稀缺的限制。从视频中学习方法旨在通过扩充传统机器人数据来缓解这一瓶颈,该数据来自大规模互联网视频。这种视频数据提供了关于物理动力学、行为和任务的基础信息,对通用机器人具有高度信息性。本综述系统性地考察了从视频中学习的新兴领域。我们首先概述了基本概念,包括详细阐述基本的从视频中学习挑战,如分布迁移和视频数据中缺失的动作标签。接着,我们全面回顾了从大规模互联网视频中提取知识的方法、克服从视频中学习挑战的方法,以及通过视频信息训练来提高机器人学习的方法。本综述以关键性讨论未来机遇结束。我们强调,需要可扩展的基础模型方法来充分利用可用互联网视频的全部范围,并增强机器人策略和动力学模型的学习。总体而言,本综述旨在为和催化未来的从视频中学习研究,推动通用机器人人工智能的进步。

关键词

引用

@article{arxiv.2404.19664,
  title  = {Towards Generalist Robot Learning from Internet Video: A Survey},
  author = {Robert McCarthy and Daniel C. H. Tan and Dominik Schmidt and Fernando Acero and Nathan Herr and Yilun Du and Thomas G. Thuruthel and Zhibin Li},
  journal= {arXiv preprint arXiv:2404.19664},
  year   = {2025}
}