Pelican-VL 1.0:面向具身智能的基础脑力模型
机器学习
2025-11-17 v2 人工智能
机器人学
摘要
本报告介绍了 Pelican-VL 1.0,这是一个由 70 亿到 72 亿参数规模的开源具身脑力模型家族。我们的明确使命是:将强大的智能嵌入到各种具身体中。Pelican-VL 1.0 当前是规模最大的开源具身多模态脑力模型。其核心优势在于对数据力量和智能自适应学习机制的深入融合。具体而言,metaloop 从包含 40 亿以上 token 的原始数据集中提炼出高质量数据集。Pelican-VL 1.0 在拥有 1000 多块 A800 GPU 的大型集群上进行训练,每个检查点消耗超过 5 万块 A800 GPU 小时。这相当于相较于其基础模型提升了 20.3% 的性能, 并以 10.6% 的优势超越 1000 亿参数规模的开源方案,在著名的具身基准测试中与领先的专有系统持平。我们建立了一种新框架,DPPO(Deliberate Practice Policy Optimization),灵感来自人类的元认知,以训练 Pelican-VL 1.0。我们将其操作化为一个 metaloop,教会 AI 进行有意识的练习,这是一个 RL-Refine-Diagnose-SFT 的循环。
引用
@article{arxiv.2511.00108,
title = {Pelican-VL 1.0: A Foundation Brain Model for Embodied Intelligence},
author = {Yi Zhang and Che Liu and Xiancong Ren and Hanchu Ni and Shuai Zhang and Zeyuan Ding and Jiayu Hu and Hanzhe Shan and Zhenwei Niu and Zhaoyang Liu and Shuang Liu and Yue Zhao and Junbo Qi and Qinfan Zhang and Dengjie Li and Yidong Wang and Jiachen Luo and Yong Dai and Zenglin Xu and Bin Shen and Qifan Wang and Jian Tang and Xiaozhu Ju},
journal= {arXiv preprint arXiv:2511.00108},
year = {2025}
}