时序图像字幕检索竞赛——描述与结果
计算机视觉与模式识别
2024-10-10 v1 计算与语言
摘要
多模态模型将视觉与文本信息相结合,近期获得了显著关注。本文针对多模态的文本-图像检索任务提出了新挑战,将时序数据纳入模态范围。本文所述的时序图像字幕检索竞赛(Temporal Image Caption Retrieval Competition, TICRC)基于慢性年鉴(Chronicling America)与具挑战性年鉴项目(Challenging America),为人们提供了覆盖274年的扫描后美国报纸的广泛集合。除竞赛结果外,我们还提供了所交付数据集分析及其创建过程的描述。
引用
@article{arxiv.2410.06314,
title = {Temporal Image Caption Retrieval Competition -- Description and Results},
author = {Jakub Pokrywka and Piotr Wierzchoń and Kornel Weryszko and Krzysztof Jassem},
journal= {arXiv preprint arXiv:2410.06314},
year = {2024}
}