从视频中提取知识图谱
计算与语言
2020-07-21 v1 人工智能
摘要
几乎所有现有的自动视频标注(或字幕生成)技术都使用自然语言句子来描述视频。然而,这存在若干缺陷:(i) 很难在自动数据处理中进一步使用所生成的自然语言标注;(ii) 生成自然语言标注需要解决生成语义精确且句法正确的自然语言句子这一困难子任务,而该子任务实际上与视频标注任务无关;(iii) 难以定量衡量性能,因为标准指标(如准确率和 F1 分数)不适用;(iv) 标注是特定于语言的。在本文中,我们提出了从视频中提取知识图谱这一新任务,即针对给定视频的内容以知识图谱的形式生成描述。由于该任务尚无数据集,我们还提出了一种从以自然语言标注视频的数据集出发自动生成此类数据集的方法。随后我们描述了一个用于从视频中提取知识图谱的初步深度学习模型,并报告了在 MSVD* 和 MSR-VTT* 上的结果,这两个数据集是使用我们的方法从 MSVD 和 MSR-VTT 得到的。
引用
@article{arxiv.2007.10040,
title = {Knowledge Graph Extraction from Videos},
author = {Louis Mahon and Eleonora Giunchiglia and Bowen Li and Thomas Lukasiewicz},
journal= {arXiv preprint arXiv:2007.10040},
year = {2020}
}
备注
10 pages, 4 figures