中文

从生成的视频字幕中抽取事件与实体

计算机视觉与模式识别 2023-09-14 v3 计算与语言

摘要

人工标注多媒体数据耗时且昂贵,而可靠地自动生成语义元数据是一项重大挑战。我们提出一个从自动生成的视频字幕中抽取语义元数据的框架。我们将实体、实体属性、实体间关系以及视频类别视为元数据。我们采用两种最先进的密集视频字幕模型——带掩码Transformer(MT)和并行解码(PVDC)——为 ActivityNet Captions 数据集的视频生成字幕。我们的实验表明,从生成的字幕中抽取实体、其实体属性、实体间关系以及视频类别是可行的。我们观察到,抽取信息的质量主要受视频中事件定位的质量以及事件字幕生成性能的影响。

关键词

引用

@article{arxiv.2211.02982,
  title  = {Event and Entity Extraction from Generated Video Captions},
  author = {Johannes Scherer and Ansgar Scherp and Deepayan Bhowmik},
  journal= {arXiv preprint arXiv:2211.02982},
  year   = {2023}
}

备注

Paper accepted at CD-MAKE 2023