ZSE-Cap:面向图像检索与引导式描述的零样图集合
计算与语言
2025-07-29 v1 信息检索
摘要
我们提出ZSE-Cap(Zero-Shot Ensemble for Captioning),这是本届 EVENTA 共享任务中得分排名第 4 的系统,用于文章关联图像检索和描述。我们的零样图方法无需对竞赛数据进行微调。检索方面,我们对 CLIP、SigLIP 和 DINOv2 的相似度得分进行集合。描述方面,我们利用精心设计的提示引导 Gemma 3 模型,将文章中的高层次事件与图像中的视觉内容关联。我们的系统在私有测试集上获得最终得分为 0.42002,位列榜单前四,展示了通过集合和提示结合基础模型有效性。我们的代码已公开于 https://github.com/ductai05/ZSE-Cap。
引用
@article{arxiv.2507.20564,
title = {ZSE-Cap: A Zero-Shot Ensemble for Image Retrieval and Prompt-Guided Captioning},
author = {Duc-Tai Dinh and Duc Anh Khoa Dinh},
journal= {arXiv preprint arXiv:2507.20564},
year = {2025}
}