面向尼泊尔语视频字幕生成的基于注意力的编码器-解码器模型 (2023)
计算机视觉与模式识别
2024-05-21 v3
摘要
尼泊尔语是一种使用天城文脚本书写的语言,由于该领域缺乏现有的学术研究,尼泊尔语的视频字幕生成提出了独特的挑战。为了解决这一难题,本工作开发了一种用于尼泊尔语视频字幕生成的新型编码器-解码器范式。该模型使用LSTM和GRU序列到序列模型,基于利用CNN从视频帧中提取的特征来生成相关的文本描述。利用Google翻译和人工后期编辑,从Microsoft Research Video Description Corpus (MSVD)数据集中生成了一个尼泊尔语视频字幕生成数据集。BLEU、METEOR和ROUGE指标被用于评估其性能,证明了该模型在天城文脚本视频字幕生成方面的有效性。
引用
@article{arxiv.2312.07418,
title = {Attention Based Encoder Decoder Model for Video Captioning in Nepali (2023)},
author = {Kabita Parajuli and Shashidhar Ram Joshi},
journal= {arXiv preprint arXiv:2312.07418},
year = {2024}
}