中文

一种用于文本-视频检索的特征空间多模态数据增强技术

计算机视觉与模式识别 2022-08-04 v1

摘要

每小时都有海量视觉内容发布于社交媒体和用户生成内容平台。为通过自然语言查询找到相关视频,文本-视频检索方法在过去几年中受到越来越多的关注。数据增强技术通过应用保留语义的变换(如图像的颜色空间或几何变换)创建新训练样本,以提升在未见测试样本上的性能。然而,这些技术通常应用于原始数据,导致解决方案资源消耗更大,且要求原始数据可共享,而这未必总成立,例如电影或电视剧片段的版权问题。为弥补这一不足,我们提出一种在特征空间工作的多模态数据增强技术,通过混合语义相似的样本来创建新视频与字幕。我们在大规模公开数据集EPIC-Kitchens-100上实验了我们的方案,相较基线方法取得了显著提升,改进了当前最优(SOTA)性能,同时进行了多项消融研究。我们在Github(https://github.com/aranciokov/FSMMDA_VideoRetrieval)上发布了代码与预训练模型。

关键词

引用

@article{arxiv.2208.02080,
  title  = {A Feature-space Multimodal Data Augmentation Technique for Text-video Retrieval},
  author = {Alex Falcon and Giuseppe Serra and Oswald Lanz},
  journal= {arXiv preprint arXiv:2208.02080},
  year   = {2022}
}

备注

Accepted for presentation at 30th ACM International Conference on Multimedia (ACM MM)