中文

Theia:从多样化视觉基础模型蒸馏用于机器人学习

机器人学 2024-10-11 v2 人工智能 计算机视觉与模式识别 机器学习

摘要

基于视觉的机器人策略学习将视觉输入映射到动作, necessitates对单一任务(如分类或分割)之外的多样化视觉任务进行整体性理解。鼓励此思路,我们引入Theia,一个用于机器人学习的视觉基础模型,通过蒸馏来自多个在各种视觉任务上训练的离线视觉基础模型。Theia的丰富视觉表征编码了多样化的视觉知识,增强了下游机器人学习。大量实验表明,Theia在使用更少的训练数据和更小的模型规模时,超过其教师模型和先前的机器人学习模型。此外,我们量化了预训练视觉表征的质量,并假设特征范数分布的更高熵导致更好的机器人学习性能。代码、模型和演示均可在https://theia.theaiinstitute.com获取。

关键词

引用

@article{arxiv.2407.20179,
  title  = {Theia: Distilling Diverse Vision Foundation Models for Robot Learning},
  author = {Jinghuan Shang and Karl Schmeckpeper and Brandon B. May and Maria Vittoria Minniti and Tarik Kelestemur and David Watkins and Laura Herlant},
  journal= {arXiv preprint arXiv:2407.20179},
  year   = {2024}
}

备注

CoRL 2024