Rudder:一个跨语言视频与文本检索数据集
信息检索
2021-03-10 v1
摘要
使用自然语言查询的视频检索需要学习文本与音视觉输入之间语义上有意义的联合嵌入。此类联合嵌入常使用成对(或三元组)对比损失目标学习,这些目标在训练时无法对“难以检索”的样本给予足够关注。在数据稀缺场景下该问题尤为突出,此时数据相对较小(大规模 MSR-VTT 的 10%)以覆盖相当复杂的音视觉嵌入空间。在此背景下,我们引入 Rudder——一个多语言视频-文本检索数据集,包含马拉地语、印地语、泰米尔语、卡纳达语、马拉雅拉姆语和泰卢固语的音轨与文本描述。此外,我们提议利用领域知识增强监督以补偿数据稀缺。为此,除常规三元组(锚点、正例、负例)的三个样本外,我们引入第四项——部分样本(partial)——以定义基于差分边界的部分序损失。部分样本经启发式采样,使其在语义上位于正例与负例的重叠区,从而获得更广的嵌入覆盖。我们的方案持续优于常规最大边界与三元组损失,并改进了 MSR-VTT 与 DiDeMO 数据集上的最优水平。我们报告了 Rudder 上的基准结果,同时观察到采用所提部分序损失带来的显著增益,尤其在利用跨语言对齐跨语言特定数据集联合训练语言特定检索模型时。
引用
@article{arxiv.2103.05457,
title = {Rudder: A Cross Lingual Video and Text Retrieval Dataset},
author = {Jayaprakash A and Abhishek and Rishabh Dabral and Ganesh Ramakrishnan and Preethi Jyothi},
journal= {arXiv preprint arXiv:2103.05457},
year = {2021}
}