EventCLIP:将 CLIP 适配于基于事件的物体识别
计算机视觉与模式识别
2023-11-20 v3
摘要
近期零样本和少样本分类的进展严重依赖于 CLIP 等预训练视觉-语言模型(VLM)的成功。由于大规模数据集的缺乏,为事件相机数据训练此类模型仍不可行。因此,将现有 VLM 跨模态适配到事件视觉是一个重要的研究挑战。本工作中,我们提出 EventCLIP,一种利用 CLIP 进行零样本和少样本基于事件的物体识别的新方法。我们首先通过将原始事件转换为基于 2D 网格的表示,将 CLIP 的图像编码器推广到事件数据。为进一步提升性能,我们提出一个特征适配器来聚合事件帧上的时间信息,并精炼文本嵌入以更好地与视觉输入对齐。我们在 N-Caltech、N-Cars 和 N-ImageNet 数据集上评估 EventCLIP,取得了最先进的少样本性能。当在整个数据集上微调时,我们的方法优于所有现有的事件分类器。此外,我们探索了 EventCLIP 的实际应用,包括鲁棒事件分类和无标签事件识别,其中我们的方法超越了专为这些任务设计的先前基线。
引用
@article{arxiv.2306.06354,
title = {EventCLIP: Adapting CLIP for Event-based Object Recognition},
author = {Ziyi Wu and Xudong Liu and Igor Gilitschenski},
journal= {arXiv preprint arXiv:2306.06354},
year = {2023}
}
备注
Add results on 1) EventCLIP with another VLM FLIP 2) inference speed analysis