GPT4Ego:释放预训练模型在零样本以自我为中心动作识别中的潜力
计算机视觉与模式识别
2024-05-14 v2
摘要
在大规模数据集上预训练的视觉 - 语言模型 (VLM) 在各种视觉识别任务中展示了令人印象深刻的性能。这一进展为零样本以自我为中心动作识别 (ZS-EAR) 的显著性能铺平了道路。通常,VLM 将 ZS-EAR 视为全局视频 - 文本匹配任务,这往往导致视觉和语言知识的次优对齐。我们提出了一种使用 VLM 进行 ZS-EAR 的改进方法,强调细粒度概念 - 描述对齐,以利用以自我为中心视频中丰富的语义和上下文细节。在本文中,我们介绍了 GPT4Ego,这是一个简单却极其强大的用于 ZS-EAR 的 VLM 框架,旨在增强视觉与语言之间概念和描述的细粒度对齐。大量实验表明,GPT4Ego 在三个大规模以自我为中心的视频基准测试上显著优于现有的 VLM,即 EPIC-KITCHENS-100 (33.2%, +9.4%)、EGTEA (39.6%, +5.5%) 和 CharadesEgo (31.5%, +2.6%)。
引用
@article{arxiv.2401.10039,
title = {GPT4Ego: Unleashing the Potential of Pre-trained Models for Zero-Shot Egocentric Action Recognition},
author = {Guangzhao Dai and Xiangbo Shu and Wenhao Wu and Rui Yan and Jiachao Zhang},
journal= {arXiv preprint arXiv:2401.10039},
year = {2024}
}