基于 CNN-RNN 架构的尼泊尔语视频描述生成
计算机视觉与模式识别
2023-11-07 v1 计算与语言
机器学习
摘要
本文介绍了利用深度神经网络进行尼泊尔语视频描述生成的研究。通过集成预训练的 CNN 与 RNN,该研究致力于为尼泊尔语视频生成精确且符合语境的描述。方法包括数据集收集、数据预处理、模型实现与评估。通过借助 Google Translate 为 MSVD 数据集补充尼泊尔语描述,本研究训练了多种 CNN-RNN 架构。研究探讨了 CNN(如 EfficientNetB0、ResNet101、VGG16)与不同 RNN 解码器(如 LSTM、GRU 和 BiLSTM)配对的有效性。评估采用 BLEU 与 METEOR 指标,最佳模型为 EfficientNetB0 + BiLSTM(隐藏维度 1024),其 BLEU-4 得分为 17,METEOR 得分为 46。文章还概述了推进尼泊尔语视频描述生成面临的挑战与未来方向,为该领域的进一步研究提供了重要资源。
引用
@article{arxiv.2311.02699,
title = {Nepali Video Captioning using CNN-RNN Architecture},
author = {Bipesh Subedi and Saugat Singh and Bal Krishna Bal},
journal= {arXiv preprint arXiv:2311.02699},
year = {2023}
}
备注
6 pages, 5 figures, 3 tables. Presented in the International Conference on Technologies for Computer, Electrical, Electronics & Communication (ICT-CEEL 2023), Bhaktapur, Nepal