中文

O2NA:一种用于可控视频描述的对象导向非自回归方法

计算与语言 2022-01-11 v2 计算机视觉与模式识别

摘要

视频描述结合了视频理解与语言生成。与描述几乎每个物体细节的静态图像描述不同,视频描述通常考虑帧序列并偏向于聚焦物体,例如无论背景如何变化都保持焦点的物体。因此,检测并恰当处理聚焦物体对视频描述至关重要。为强化对聚焦物体的描述并实现可控视频描述,我们提出一种对象导向非自回归方法(O2NA),其分三步生成描述:1)识别聚焦物体并预测其在目标描述中的位置;2)生成这些聚焦物体的相关属性词与关系词以形成草稿描述;3)结合视频信息将草稿描述精炼为流畅的最终描述。由于聚焦物体在其它词之前生成并定位,难以应用逐词自回归生成过程;因此我们采用非自回归方法。在两个基准数据集MSR-VTT与MSVD上的实验证明了O2NA的有效性,其取得了与最先进方法竞争的结果,且兼具更高多样性与更高推理速度。

关键词

引用

@article{arxiv.2108.02359,
  title  = {O2NA: An Object-Oriented Non-Autoregressive Approach for Controllable Video Captioning},
  author = {Fenglin Liu and Xuancheng Ren and Xian Wu and Bang Yang and Shen Ge and Yuexian Zou and Xu Sun},
  journal= {arXiv preprint arXiv:2108.02359},
  year   = {2022}
}

备注

Accepted by Findings of ACL 2021 (The Joint Conference of the 59th Annual Meeting of the Association for Computational Linguistics and the 11th International Joint Conference on Natural Language Processing)