你能从肌肉中学到什么?从人类交互中学习视觉表征
计算机视觉与模式识别
2021-03-09 v2
摘要
学习能够有效泛化到各种下游任务的视觉数据表征一直是计算机视觉领域的长期追求。大多数表征学习方法仅依赖图像或视频等视觉数据。在本文中,我们探索了一种新颖的方法,利用人类交互与注意力线索来探究我们是否能学到比仅视觉表征更好的表征。为此研究,我们收集了一个捕捉日常生活中身体部位运动和注视的人类交互数据集。我们的实验表明,编码交互与注意力线索的“肌肉监督”表征在多种目标任务上优于仅视觉的最先进方法 MoCo (He et al., 2020):场景分类(语义)、动作识别(时序)、深度估计(几何)、动力学预测(物理)以及可行走表面估计(可供性)。我们的代码与数据集可在 https://github.com/ehsanik/muscleTorch 获取。
引用
@article{arxiv.2010.08539,
title = {What Can You Learn from Your Muscles? Learning Visual Representation from Human Interactions},
author = {Kiana Ehsani and Daniel Gordon and Thomas Nguyen and Roozbeh Mottaghi and Ali Farhadi},
journal= {arXiv preprint arXiv:2010.08539},
year = {2021}
}
备注
Published as a conference paper at ICLR 2021