中文

面向尼泊尔语视频字幕生成的基于注意力的编码器-解码器模型 (2023)

计算机视觉与模式识别 2024-05-21 v3

摘要

尼泊尔语是一种使用天城文脚本书写的语言,由于该领域缺乏现有的学术研究,尼泊尔语的视频字幕生成提出了独特的挑战。为了解决这一难题,本工作开发了一种用于尼泊尔语视频字幕生成的新型编码器-解码器范式。该模型使用LSTM和GRU序列到序列模型,基于利用CNN从视频帧中提取的特征来生成相关的文本描述。利用Google翻译和人工后期编辑,从Microsoft Research Video Description Corpus (MSVD)数据集中生成了一个尼泊尔语视频字幕生成数据集。BLEU、METEOR和ROUGE指标被用于评估其性能,证明了该模型在天城文脚本视频字幕生成方面的有效性。

关键词

引用

@article{arxiv.2312.07418,
  title  = {Attention Based Encoder Decoder Model for Video Captioning in Nepali (2023)},
  author = {Kabita Parajuli and Shashidhar Ram Joshi},
  journal= {arXiv preprint arXiv:2312.07418},
  year   = {2024}
}