中文

C2KD:用于多语言文本-视频检索的跨语言跨模态知识蒸馏

计算与语言 2023-05-11 v2 计算机视觉与模式识别 多媒体

摘要

多语言文本-视频检索方法近年来显著改进,但其他语言的性能仍落后于英语。我们提出一种跨语言跨模态知识蒸馏方法以改进多语言文本-视频检索。受英语文本-视频检索优于其他语言这一事实的启发,我们训练一个学生模型,使用不同语言的输入文本来匹配使用英语输入文本的教师模型的跨模态预测。我们提出一种基于交叉熵的目标函数,迫使学生模型的文本-视频相似度分数分布与教师模型相似。我们通过将 YouCook2 视频数据集的英文字幕翻译为其他 8 种语言,引入了一个新的多语言视频数据集 Multi-YouCook2。我们的方法在 Multi-YouCook2 及 Multi-MSRVTT、VATEX 等多个其他数据集上提升了多语言文本-视频检索性能。我们还分析了不同多语言文本模型作为教师的有效性。代码、模型与数据集可在 https://github.com/roudimit/c2kd 获取。

关键词

引用

@article{arxiv.2210.03625,
  title  = {C2KD: Cross-Lingual Cross-Modal Knowledge Distillation for Multilingual Text-Video Retrieval},
  author = {Andrew Rouditchenko and Yung-Sung Chuang and Nina Shvetsova and Samuel Thomas and Rogerio Feris and Brian Kingsbury and Leonid Karlinsky and David Harwath and Hilde Kuehne and James Glass},
  journal= {arXiv preprint arXiv:2210.03625},
  year   = {2023}
}

备注

Accepted at ICASSP 2023. The code, models, and dataset are available at https://github.com/roudimit/c2kd