中文

GPT4Ego:释放预训练模型在零样本以自我为中心动作识别中的潜力

计算机视觉与模式识别 2024-05-14 v2

摘要

在大规模数据集上预训练的视觉 - 语言模型 (VLM) 在各种视觉识别任务中展示了令人印象深刻的性能。这一进展为零样本以自我为中心动作识别 (ZS-EAR) 的显著性能铺平了道路。通常,VLM 将 ZS-EAR 视为全局视频 - 文本匹配任务,这往往导致视觉和语言知识的次优对齐。我们提出了一种使用 VLM 进行 ZS-EAR 的改进方法,强调细粒度概念 - 描述对齐,以利用以自我为中心视频中丰富的语义和上下文细节。在本文中,我们介绍了 GPT4Ego,这是一个简单却极其强大的用于 ZS-EAR 的 VLM 框架,旨在增强视觉与语言之间概念和描述的细粒度对齐。大量实验表明,GPT4Ego 在三个大规模以自我为中心的视频基准测试上显著优于现有的 VLM,即 EPIC-KITCHENS-100 (33.2%, +9.4%)、EGTEA (39.6%, +5.5%) 和 CharadesEgo (31.5%, +2.6%)。

关键词

引用

@article{arxiv.2401.10039,
  title  = {GPT4Ego: Unleashing the Potential of Pre-trained Models for Zero-Shot Egocentric Action Recognition},
  author = {Guangzhao Dai and Xiangbo Shu and Wenhao Wu and Rui Yan and Jiachao Zhang},
  journal= {arXiv preprint arXiv:2401.10039},
  year   = {2024}
}