时空逆转:面向跨模态视频文本检索的新型时序突出基准
计算机视觉与模式识别
2025-09-30 v2 人工智能
计算与语言
信息检索
机器学习
摘要
跨模态(如图像-文本、视频-文本)检索是信息检索和多模态视觉语言理解领域的重要任务。时序理解使得视频-文本检索比图像-文本检索更具挑战性。然而,我们发现现有广泛使用的视频-文本基准在全面评估模型能力方面存在不足,尤其是在时序理解方面,这导致大规模图像-文本预训练模型已能实现与视频-文本预训练模型相当的零样本性能。本文引入RTime(Reversed in Time),一个新型时序突出视频-文本检索数据集。我们首先获取具有显著时序性质的行为或事件视频,然后反转这些视频以创建更难的负样本。随后,我们邀请标注员判断候选视频的显著性和可逆性,并为合格视频撰写描述。我们进一步采用GPT-4基于人工编写的描述扩展更多caption。当前,RTime数据集包含2.1万个视频,每个视频10个caption,总计约122小时。基于RTime,我们提出三种检索基准任务:RTime-Origin、RTime-Hard和RTime-Binary。我们进一步增强了模型训练中更难负样本的使用,并在RTime上对多种视频-文本模型进行基准测试。大量实验分析表明,RTime确实为视频-文本检索带来了新的和更高的挑战。我们发布RTime数据集 https://github.com/qyr0403/Reversed-in-Time 以推动视频-文本检索和多模态理解研究的进一步发展。
引用
@article{arxiv.2412.19178,
title = {Reversed in Time: A Novel Temporal-Emphasized Benchmark for Cross-Modal Video-Text Retrieval},
author = {Yang Du and Yuqi Liu and Qin Jin},
journal= {arXiv preprint arXiv:2412.19178},
year = {2025}
}
备注
ACMMM 2024 poster