用于视频字幕生成的 METEOR 引导散度
计算机视觉与模式识别
2022-12-22 v1 计算与语言
机器学习
摘要
自动视频字幕生成旨在实现整体的视觉场景理解。它需要一种能够捕捉视频帧中时间上下文的机制,以及在给定时间范围内理解对象动作与关联的能力。这样的系统还应学会将视频序列抽象为合理的表示,并生成自然的书面语言。尽管大多数字幕生成模型仅关注视觉输入,但视听模态却鲜受关注。为了解决这一问题,我们提出了一种新颖的双重方法。首先,我们实现了一种奖励引导的 KL 散度来训练视频字幕生成模型,使其对 token 排列具有鲁棒性。其次,我们采用双模态分层强化学习(BMHRL)Transformer 架构来捕捉输入数据的长期时间依赖关系,作为我们分层字幕生成模块的基础。使用我们的 BMHRL,我们展示了 HRL 智能体在生成内容完整且语法正确的句子方面的适用性,在 ActivityNet Captions 数据集上的 BLEU3、BLEU4 和 METEOR 分数分别达到了 、 和 。最后,我们在 https://github.com/d-rothen/bmhrl 上公开了我们的 BMHRL 框架和训练好的模型,供用户和开发者使用。
引用
@article{arxiv.2212.10690,
title = {METEOR Guided Divergence for Video Captioning},
author = {Daniel Lukas Rothenpieler and Shahin Amiriparian},
journal= {arXiv preprint arXiv:2212.10690},
year = {2022}
}