用于图像与视频语音描述的转写增强联合嵌入
计算机视觉与模式识别
2020-06-02 v1 计算与语言
信息检索
多媒体
摘要
在本工作中,我们提出一种通过结合三种同时模态:图像、口语叙述和文本叙述来训练独特嵌入表示的有效方法。所提出的方法论脱离仅用口语叙述和图像线索训练得到的嵌入空间的基线系统。我们在 EPIC-Kitchen 和 Places Audio Caption 数据集上的实验表明,引入口语叙述的人工生成文本转写有助于训练过程,从而获得更好的嵌入表示。语音、图像和词语的三元组允许更好地估计点嵌入,并显示出在图像和语音检索等任务中性能的提升,即使在任务中不存在第三模态文本时也是如此。
引用
@article{arxiv.2006.00785,
title = {Transcription-Enriched Joint Embeddings for Spoken Descriptions of Images and Videos},
author = {Benet Oriol and Jordi Luque and Ferran Diego and Xavier Giro-i-Nieto},
journal= {arXiv preprint arXiv:2006.00785},
year = {2020}
}
备注
Accepted for presentation at EPIC@CVPR2020 workshop