中文

用于基于视频的常识字幕的混合推理网络

计算机视觉与模式识别 2021-08-06 v1 计算与语言

摘要

基于视频的常识字幕任务旨在生成事件级字幕,同时提供关于视频中底层事件的多种常识描述(例如属性、效果和意图)。先前的工作通过使用独立网络处理不同常识类型来探索常识字幕,这耗时且缺乏对不同类型的常识之间交互的挖掘。在本文中,我们提出一种混合推理网络(HybridNet),赋予神经网络语义级推理与词级推理的能力。首先,我们通过在一个统一网络中联合训练不同常识类型来开发用于语义级推理的多常识学习,这促进了多种常识描述、事件级字幕与视频的线索之间的交互。然后,分两步实现词级推理:(1)记忆模块记录先前生成过程的历史预测序列;(2)记忆路由多头注意力(MMHA)模块通过将记忆模块的历史信息整合进transformer解码器来更新词级注意力图以实现词级推理。此外,多模态特征被用于充分利用多样知识进行常识推理。在大规模Video-to-Commonsense基准上的实验与丰富分析表明,我们的HybridNet相较于其他方法取得了最先进的性能。

关键词

引用

@article{arxiv.2108.02365,
  title  = {Hybrid Reasoning Network for Video-based Commonsense Captioning},
  author = {Weijiang Yu and Jian Liang and Lei Ji and Lu Li and Yuejian Fang and Nong Xiao and Nan Duan},
  journal= {arXiv preprint arXiv:2108.02365},
  year   = {2021}
}

备注

11 pages, 6 figures