中文

语义深化:利用语义语境化进行视频活动解释

计算机视觉与模式识别 2018-11-16 v3

摘要

对视频活动的深入理解超越了对动作和物体等底层概念的识别:构建深度语义表示需要推理这些概念之间的语义关系,这通常超越了数据中直接观察到的内容。为此,我们提出了一种能量最小化框架,该框架利用大规模常识知识库(如 ConceptNet)提供上下文线索,以建立直接从视频信号中假设的实体之间的语义关系。我们使用 Grenander 的典型模式生成器理论的语言对其进行数学表达。我们表明,使用预先编码的常识知识减轻了对大型标注训练数据集的需求,并有助于通过先验知识解决训练中的不平衡问题。使用三个不同的公开数据集——Charades、Microsoft Visual Description Corpus 和 Breakfast Actions 数据集,我们表明所提出的模型生成的视频解释质量优于现有 SOTA 方法所报告的结果,而这些方法具有大量的训练需求。通过大量实验,我们表明利用 ConceptNet 的常识知识使所提出的方法能够应对各种挑战,例如训练数据不平衡、弱特征以及复杂的语义关系和视觉场景。

关键词

引用

@article{arxiv.1708.03725,
  title  = {Going Deeper with Semantics: Video Activity Interpretation using Semantic Contextualization},
  author = {Sathyanarayanan N. Aakur and Fillipe DM de Souza and Sudeep Sarkar},
  journal= {arXiv preprint arXiv:1708.03725},
  year   = {2018}
}

备注

Accepted to WACV 2019