自然语言事件描述的组合式时间视觉定位
计算机视觉与模式识别
2019-12-06 v1
摘要
时间定位旨在建立自然语言事件描述与其视觉描绘之间的对应关系。组合式建模成为核心:我们首先将原子描述“女孩吃苹果”“击球手击球”定位到短视频片段,然后建立这些片段之间的时间关系。这种组合结构使模型能够通过识别原子子事件来识别训练期间未见过的更多样化的事件。显式的时间建模考虑了语言中可表达的各种时间关系:例如,在描述“女孩吃完苹果后从桌边站起来”中,事件的视觉顺序是颠倒的,先是“吃苹果”,然后是“从桌边站起来”。我们利用这些观察结果开发了一个统一的深度架构 CTG-Net,用于对自然语言事件描述进行视频时间定位。我们证明,在 DiDeMo、Tempo-TL 和 Tempo-HL 时间定位数据集上,我们的系统优于先前的 SOTA 方法。
引用
@article{arxiv.1912.02256,
title = {Compositional Temporal Visual Grounding of Natural Language Event Descriptions},
author = {Jonathan C. Stroud and Ryan McCaffrey and Rada Mihalcea and Jia Deng and Olga Russakovsky},
journal= {arXiv preprint arXiv:1912.02256},
year = {2019}
}
备注
Project page: jonathancstroud.com/ctg