通过适应互联网视频知识来解决新任务
机器学习
2025-04-23 v1 人工智能
机器人学
摘要
视频生成模型在机器人领域展现出巨大潜力,充当视觉规划器或策略监督器。当它们在互联网规模数据上进行预训练时,这类视频模型能够深入理解自然语言的对齐性,从而通过文本条件化促进对新下游行为的泛化。然而,这些模型可能不够敏感于智能体所驻留环境的特定细节。另一方面,基于机器人行为的领域数据训练视频模型自然会编码环境的特定细节,但可获得示范数据的规模可能不足以通过自然语言规范实现对未见任务的泛化。在本工作中,我们探讨了不同适应技术,这些技术将领域信息与大规模预训练视频模型相结合,探索它们在机器人任务上实现新型文本条件化泛化的程度,同时也考虑其独立的数据和资源因素。我们在机器人环境中成功演示了,通过小规模示例数据适应强大的视频模型即可成功促进对新行为的泛化。特别地,我们提出了一种新颖的适应策略,称为逆概率适应(Inverse Probabilistic Adaptation),该策略不仅在机器人任务和环境中持续实现出色的泛化性能,而且对适应数据的质量具有鲁棒性,即使只有次优的领域示范也能成功解决新任务。
引用
@article{arxiv.2504.15369,
title = {Solving New Tasks by Adapting Internet Video Knowledge},
author = {Calvin Luo and Zilai Zeng and Yilun Du and Chen Sun},
journal= {arXiv preprint arXiv:2504.15369},
year = {2025}
}
备注
ICLR 2025. Project Webpage: https://diffusion-supervision.github.io/adapt2act/