MART:用于连贯视频段落字幕生成的记忆增强循环 Transformer
计算与语言
2020-05-13 v1 计算机视觉与模式识别
机器学习
摘要
为视频生成多句描述是最具挑战性的字幕任务之一,因为它不仅对视觉相关性有很高要求,还要求段落中各句子之间基于语篇的连贯性。为此,我们提出一种称为记忆增强循环 Transformer(MART)的新方法,其使用记忆模块来增强 Transformer 架构。记忆模块从视频片段和句子历史中生成高度概括的记忆状态,以帮助更好地预测下一句(在共指和重复方面),从而鼓励连贯的段落生成。在 ActivityNet Captions 和 YouCookII 两个流行数据集上的大量实验、人工评估和定性分析表明,MART 比基线方法生成更连贯、更少重复的段落字幕,同时保持与输入视频事件的相关性。所有代码开源于:https://github.com/jayleicn/recurrent-transformer
引用
@article{arxiv.2005.05402,
title = {MART: Memory-Augmented Recurrent Transformer for Coherent Video Paragraph Captioning},
author = {Jie Lei and Liwei Wang and Yelong Shen and Dong Yu and Tamara L. Berg and Mohit Bansal},
journal= {arXiv preprint arXiv:2005.05402},
year = {2020}
}
备注
ACL 2020 (12 pages)