中文

COBE:从带解说 instructional 视频中学习上下文感知的物体嵌入

计算机视觉与模式识别 2020-11-02 v2

摘要

现实世界中的许多物体在视觉外观上会发生剧烈变化。例如,番茄可能是红色或绿色的、切片的或切碎的、新鲜的或油炸的、液态的或固态的。训练单一检测器在所有这些不同状态下准确识别番茄具有挑战性。另一方面,上下文线索(例如,刀、砧板、漏勺或平底锅的存在)通常强烈指示物体在场景中的外观。识别此类上下文线索不仅有助于提升物体检测的准确性或确定物体的状态,还有助于理解其功能属性并推断正在进行或即将发生的人-物交互。遗憾的是,在现实世界中完全监督地识别物体状态及其上下文的方法受到数据长尾、开放分布的影响,这 effectively 需要大量标注才能捕捉物体所有不同形态下的外观。我们不为该任务依赖人工标注数据,而是提出一种从教学视频的自动转写解说中学习上下文化物体嵌入(COBE)的新框架。我们通过训练视觉检测器来预测物体及其相关解说的上下文化词嵌入,从而利用语言的语义与组合结构。这使得学习到的物体表示中概念依据语义语言度量相关联。我们的实验表明,我们的检测器学会了预测丰富的上下文物体信息,并且在少样本和零样本学习设定下极为有效。

关键词

引用

@article{arxiv.2007.07306,
  title  = {COBE: Contextualized Object Embeddings from Narrated Instructional Video},
  author = {Gedas Bertasius and Lorenzo Torresani},
  journal= {arXiv preprint arXiv:2007.07306},
  year   = {2020}
}

备注

NeurIPS 2020