利用生成式字幕和多词概念库改进即席视频搜索的可解释嵌入
计算机视觉与模式识别
2024-04-10 v1
摘要
在跨模态潜在空间中对齐用户查询和视频片段,以及利用语义概念对齐,是即席视频搜索(AVS)的两种主流方法。然而,现有方法的有效性受到可用视频-文本数据集规模小和概念库质量低的瓶颈限制,导致对未见查询的失败和词汇外问题。本文通过构建新数据集和开发多词概念库来解决这两个问题。具体而言,利用生成模型,我们构建了一个包含700万生成文本-视频对的新数据集用于预训练。为解决词汇外问题,我们基于句法分析开发了一个多词概念库,以增强最先进的可解释AVS方法在建模查询词之间关系的能力。我们还研究了当前先进特征对该方法的影响。实验结果表明,上述提出元素的集成使AVS方法在MSRVTT数据集上的R@1性能翻倍,并在TRECVid AVS查询集(2016-2023,八年)上将xinfAP提高了2%到77%,平均约20%。
引用
@article{arxiv.2404.06173,
title = {Improving Interpretable Embeddings for Ad-hoc Video Search with Generative Captions and Multi-word Concept Bank},
author = {Jiaxin Wu and Chong-Wah Ngo and Wing-Kwong Chan},
journal= {arXiv preprint arXiv:2404.06173},
year = {2024}
}
备注
Accepted in ICMR2024