CEIA:基于 CLIP 的事件-图像对齐用于开放世界事件-based 理解
计算机视觉与模式识别
2024-07-10 v1 人工智能
摘要
我们提出了 CEIA,一个用于开放世界事件-based 理解的有效框架。目前训练大型事件-文本模型仍面临数据缺乏的巨大挑战。为此,CEIA learns to align event and image data as an alternative to directly aligning event and text data. 具体而言,我们利用丰富的事件-图像数据集,通过对比学习学习事件嵌入空间与 CLIP 图像空间的对齐。如此一来,事件和文本数据可通过图像数据作为桥梁自然对齐。特别地,CEIA 提供了两大_distinct 的优势:首先,它允许我们充分利用现有的事件-图像数据集来弥补大规模事件-文本数据集的不足;其次,凭借更丰富的训练数据,CEIA 也展现出提升性能的灵活性,确保可扩展性。为突出框架的通用性,我们通过多种事件-多模态应用进行了广泛评估,包括目标识别、事件-图像检索、事件-文本检索和领域适应。结果表明,CEIA 在这些应用上具有显著的零样性能优于现有方法。
引用
@article{arxiv.2407.06611,
title = {CEIA: CLIP-Based Event-Image Alignment for Open-World Event-Based Understanding},
author = {Wenhao Xu and Wenming Weng and Yueyi Zhang and Zhiwei Xiong},
journal= {arXiv preprint arXiv:2407.06611},
year = {2024}
}