中文

Ego-Exo:将视觉表征从第三人称视频迁移至第一人称视频

计算机视觉与模式识别 2021-04-19 v1

摘要

我们提出了一种利用大规模第三人称视频数据集预训练第一人称视频模型的方法。仅从第一人称数据学习受限于数据集规模小和多样性不足,而仅使用第三人称(外部视角)数据则会引入较大的领域差异。我们的思路是在第三人称视频中发现可预测关键第一人称特有属性的潜在信号。在预训练阶段将这些信号作为知识蒸馏损失融入模型,所得模型既受益于第三人称视频数据的规模与多样性,又获得了捕捉显著第一人称特性的表征。实验表明,我们的 Ego-Exo 框架可无缝集成到标准视频模型中;在微调用于第一人称活动识别时优于所有基线方法,在 Charades-Ego 和 EPIC-Kitchens-100 上取得了最先进的结果。

关键词

引用

@article{arxiv.2104.07905,
  title  = {Ego-Exo: Transferring Visual Representations from Third-person to First-person Videos},
  author = {Yanghao Li and Tushar Nagarajan and Bo Xiong and Kristen Grauman},
  journal= {arXiv preprint arXiv:2104.07905},
  year   = {2021}
}

备注

Accepted by CVPR-2021