Theia:从多样化视觉基础模型蒸馏用于机器人学习
机器人学
2024-10-11 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
基于视觉的机器人策略学习将视觉输入映射到动作, necessitates对单一任务(如分类或分割)之外的多样化视觉任务进行整体性理解。鼓励此思路,我们引入Theia,一个用于机器人学习的视觉基础模型,通过蒸馏来自多个在各种视觉任务上训练的离线视觉基础模型。Theia的丰富视觉表征编码了多样化的视觉知识,增强了下游机器人学习。大量实验表明,Theia在使用更少的训练数据和更小的模型规模时,超过其教师模型和先前的机器人学习模型。此外,我们量化了预训练视觉表征的质量,并假设特征范数分布的更高熵导致更好的机器人学习性能。代码、模型和演示均可在https://theia.theaiinstitute.com获取。
引用
@article{arxiv.2407.20179,
title = {Theia: Distilling Diverse Vision Foundation Models for Robot Learning},
author = {Jinghuan Shang and Karl Schmeckpeper and Brandon B. May and Maria Vittoria Minniti and Tarik Kelestemur and David Watkins and Laura Herlant},
journal= {arXiv preprint arXiv:2407.20179},
year = {2024}
}
备注
CoRL 2024