基于编码器-解码器的长短期记忆(LSTM)模型用于视频字幕生成
计算机视觉与模式识别
2024-01-05 v1
摘要
本工作演示了使用编码器-解码器模型实现视频数据到文本字幕的多对多映射。多对多映射通过输入视频帧的时间序列到输出单词序列以形成字幕句子。讨论了数据预处理、模型构建和模型训练。使用数据集不同分割上的2-gram BLEU分数评估字幕正确性。展示了输出字幕的具体示例,以证明模型在视频时间维度上的泛化能力。预测的字幕被证明能够泛化视频动作,即使在视频场景发生剧烈变化的情况下。讨论了模型架构变化以改善句子语法和正确性。
引用
@article{arxiv.2401.02052,
title = {Encoder-Decoder Based Long Short-Term Memory (LSTM) Model for Video Captioning},
author = {Sikiru Adewale and Tosin Ige and Bolanle Hafiz Matti},
journal= {arXiv preprint arXiv:2401.02052},
year = {2024}
}