MSVD-Indonesian:面向印尼语多模态视频-文本任务的基准数据集
多媒体
2025-07-15 v2 计算与语言
计算机视觉与模式识别
机器学习
图像与视频处理
摘要
视频与文本上的多模态学习已取得显著进展,尤其在文本到视频检索、视频到文本检索和视频描述等任务中。然而,大多数现有方法与数据集仅关注英语。尽管印尼语是使用最广泛的语言之一,印尼语多模态研究仍待深入探索,主要由于缺乏基准数据集。为弥补这一空白,我们通过将 MSVD 数据集中的英文描述翻译为印尼语,引入了首个公开的印尼语视频-文本数据集。利用该数据集,我们评估了为英文视频-文本数据集开发的神经网络模型在三项任务上的表现,即文本到视频检索、视频到文本检索和视频描述。大多数现有模型依赖于在英语视觉-语言数据集上预训练的特征提取器,考虑到印尼语大规模预训练资源的稀缺,这引发了其对该语言适用性的担忧。我们采用跨语言迁移学习方法,利用英语预训练的提取器并在我们的印尼语数据集上微调模型。实验结果表明,该策略在所有任务与指标上均提升了性能。我们公开了数据集以支持未来研究,并希望其能推动印尼语多模态学习的进一步进展。
引用
@article{arxiv.2306.11341,
title = {MSVD-Indonesian: A Benchmark for Multimodal Video-Text Tasks in Indonesian},
author = {Willy Fitra Hendria},
journal= {arXiv preprint arXiv:2306.11341},
year = {2025}
}
备注
10 pages, 5 figures, 5 tables