中文

MSVD-Indonesian:面向印尼语多模态视频-文本任务的基准数据集

多媒体 2025-07-15 v2 计算与语言 计算机视觉与模式识别 机器学习 图像与视频处理

摘要

视频与文本上的多模态学习已取得显著进展,尤其在文本到视频检索、视频到文本检索和视频描述等任务中。然而,大多数现有方法与数据集仅关注英语。尽管印尼语是使用最广泛的语言之一,印尼语多模态研究仍待深入探索,主要由于缺乏基准数据集。为弥补这一空白,我们通过将 MSVD 数据集中的英文描述翻译为印尼语,引入了首个公开的印尼语视频-文本数据集。利用该数据集,我们评估了为英文视频-文本数据集开发的神经网络模型在三项任务上的表现,即文本到视频检索、视频到文本检索和视频描述。大多数现有模型依赖于在英语视觉-语言数据集上预训练的特征提取器,考虑到印尼语大规模预训练资源的稀缺,这引发了其对该语言适用性的担忧。我们采用跨语言迁移学习方法,利用英语预训练的提取器并在我们的印尼语数据集上微调模型。实验结果表明,该策略在所有任务与指标上均提升了性能。我们公开了数据集以支持未来研究,并希望其能推动印尼语多模态学习的进一步进展。

关键词

引用

@article{arxiv.2306.11341,
  title  = {MSVD-Indonesian: A Benchmark for Multimodal Video-Text Tasks in Indonesian},
  author = {Willy Fitra Hendria},
  journal= {arXiv preprint arXiv:2306.11341},
  year   = {2025}
}

备注

10 pages, 5 figures, 5 tables