中文

CEIA:基于 CLIP 的事件-图像对齐用于开放世界事件-based 理解

计算机视觉与模式识别 2024-07-10 v1 人工智能

摘要

我们提出了 CEIA,一个用于开放世界事件-based 理解的有效框架。目前训练大型事件-文本模型仍面临数据缺乏的巨大挑战。为此,CEIA learns to align event and image data as an alternative to directly aligning event and text data. 具体而言,我们利用丰富的事件-图像数据集,通过对比学习学习事件嵌入空间与 CLIP 图像空间的对齐。如此一来,事件和文本数据可通过图像数据作为桥梁自然对齐。特别地,CEIA 提供了两大_distinct 的优势:首先,它允许我们充分利用现有的事件-图像数据集来弥补大规模事件-文本数据集的不足;其次,凭借更丰富的训练数据,CEIA 也展现出提升性能的灵活性,确保可扩展性。为突出框架的通用性,我们通过多种事件-多模态应用进行了广泛评估,包括目标识别、事件-图像检索、事件-文本检索和领域适应。结果表明,CEIA 在这些应用上具有显著的零样性能优于现有方法。

关键词

引用

@article{arxiv.2407.06611,
  title  = {CEIA: CLIP-Based Event-Image Alignment for Open-World Event-Based Understanding},
  author = {Wenhao Xu and Wenming Weng and Yueyi Zhang and Zhiwei Xiong},
  journal= {arXiv preprint arXiv:2407.06611},
  year   = {2024}
}