面向即席视频搜索的可解释嵌入
计算机视觉与模式识别
2024-02-20 v1 多媒体
摘要
长期以来,利用语义概念回答查询一直是视频搜索的主流方法。直到最近,其性能被无概念方法超越,后者将查询和视频嵌入到联合空间中。然而,嵌入特征及搜索结果缺乏可解释性,阻碍了后续的视频浏览和查询重构步骤。本文将特征嵌入与概念解释集成到一个神经网络中,用于统一的双任务学习。通过这种方式,嵌入与一系列语义概念相关联,作为对视频内容的解释。本文实证表明,无论是使用嵌入特征还是概念,在 TRECVid 基准数据集上均可实现显著的视频搜索改进。概念不仅能有效剪枝假阳性视频,而且与无概念搜索高度互补,相比最先进方法带来了大幅度的性能提升。
引用
@article{arxiv.2402.11812,
title = {Interpretable Embedding for Ad-hoc Video Search},
author = {Jiaxin Wu and Chong-Wah Ngo},
journal= {arXiv preprint arXiv:2402.11812},
year = {2024}
}
备注
accepted in ACMMM 2020