中文

X-MIC:用于第一人称动作泛化的跨模态实例条件化

计算机视觉与模式识别 2024-04-01 v1

摘要

最近,由于视觉语言模型(VLM)在零样本识别中的成功,将其适配于图像和第三人称视频分类引起了越来越多的兴趣。然而,将这些模型适配于第一人称视频在很大程度上尚未被探索。为了填补这一空白,我们提出了一个简单而有效的跨模态适配框架,我们称之为 X-MIC。使用视频适配器,我们的流水线学习在共享嵌入空间中直接将冻结的文本嵌入与每个第一人称视频对齐。我们新颖的适配器架构通过解耦可学习的时序建模和冻结的视觉编码器,保留并提高了预训练 VLM 的泛化能力。这导致文本嵌入与每个第一人称视频的对齐得到增强,从而显著改善了跨数据集泛化能力。我们在 Epic-Kitchens、Ego4D 和 EGTEA 数据集上评估了我们的方法,用于细粒度跨数据集动作泛化,证明了我们方法的有效性。代码可在 https://github.com/annusha/xmic 获取。

关键词

引用

@article{arxiv.2403.19811,
  title  = {X-MIC: Cross-Modal Instance Conditioning for Egocentric Action Generalization},
  author = {Anna Kukleva and Fadime Sener and Edoardo Remelli and Bugra Tekin and Eric Sauser and Bernt Schiele and Shugao Ma},
  journal= {arXiv preprint arXiv:2403.19811},
  year   = {2024}
}

备注

CVPR 2024