用于视频字幕的判别性潜语义图
计算机视觉与模式识别
2021-08-11 v2
摘要
视频字幕旨在自动生成可描述给定视频视觉内容的自然语言句子。现有的生成模型如编码器-解码器框架无法显式地从复杂时空数据中探索物体级交互与帧级信息以生成语义丰富的字幕。我们的主要贡献是在一个面向未来视频摘要任务的联合框架中识别三个关键问题。1)增强物体提议:我们提出一种新颖的条件图,可将时空信息融合进潜物体提议。2)视觉知识:提出潜提议聚合以动态提取具有更高语义层次的视觉词。3)句子验证:提出一种新颖的判别性语言验证器来验证生成的字幕,从而有效保留关键语义概念。我们在两个公开数据集(MVSD和MSR-VTT)上的实验表明,在所有指标上相较SOTA方法均有显著提升,尤其是BLEU-4和CIDEr。我们的代码见 https://github.com/baiyang4/D-LSG-Video-Caption。
引用
@article{arxiv.2108.03662,
title = {Discriminative Latent Semantic Graph for Video Captioning},
author = {Yang Bai and Junyan Wang and Yang Long and Bingzhang Hu and Yang Song and Maurice Pagnucco and Yu Guan},
journal= {arXiv preprint arXiv:2108.03662},
year = {2021}
}
备注
accepted by ACM MM 2021