以 FIRE 对抗 FIRe:评估文本到视频检索基准的有效性
计算与语言
2023-04-20 v2 计算机视觉与模式识别
摘要
使用文本描述搜索海量视频是一项核心的多模态检索任务。由于缺乏专门为文本到视频检索构建的数据集,视频字幕数据集被重新用于评估模型,方法是:(1) 将字幕视为与其各自视频的正样本匹配,以及 (2) 假设所有其他视频为负样本。然而,这种方法在评估期间导致了根本性的缺陷:由于字幕仅被标记为与其原始视频相关,许多备选视频实际上也与该字幕匹配,从而引入了假阴性字幕-视频对。我们表明,当这些假阴性样本被纠正后,一个最近的最先进模型获得了 25% 的召回率点数提升——这一差异威胁到了基准测试本身的有效性。为了诊断和缓解这一问题,我们标注并发布了 683K 个额外的字幕-视频对。利用这些数据,我们在两个标准基准测试(MSR-VTT 和 MSVD)上重新计算了三个模型的有效性得分。我们发现:(1) 对于最佳模型,重新计算的指标在召回率点数上最高可提升 25%;(2) 这些基准测试在 Recall@10 上已接近饱和;(3) 字幕长度(泛化性)与正样本数量相关;(4) 标注成本可以通过采样来缓解。我们建议以当前形式淘汰这些基准测试,并对未来的文本到视频检索基准测试提出建议。
引用
@article{arxiv.2210.05038,
title = {Fighting FIRe with FIRE: Assessing the Validity of Text-to-Video Retrieval Benchmarks},
author = {Pedro Rodriguez and Mahmoud Azab and Becka Silvert and Renato Sanchez and Linzy Labson and Hardik Shah and Seungwhan Moon},
journal= {arXiv preprint arXiv:2210.05038},
year = {2023}
}
备注
EACL 2023 Camera Ready