中文

视频知识图谱抽取的 Detection-Fusion 方法

计算机视觉与模式识别 2025-01-03 v1 人工智能 机器学习

摘要

视频理解中的一个具有挑战性的任务是从视频输入中提取语义内容。大多数现有系统使用语言模型将视频描述为自然语言句子,但存在诸多主要缺点。此类系统过度依赖语言模型组件,基于自然语言文本中的统计规律来决定输出,而非视频的视觉内容。此外,自然语言注释难以被计算机处理,难以使用性能指标进行评估,也难以翻译成其他自然语言。在本文中,我们提出了一种为视频标注知识图谱的方法,以避免上述问题。具体而言,我们提出了一种基于深度学习的模型用于该任务,首先预测个体之间的配对,然后预测它们之间的关系。此外,我们提出了该模型的一个扩展版本,用于在知识图谱构建中包含背景知识。

关键词

引用

@article{arxiv.2501.00136,
  title  = {Detection-Fusion for Knowledge Graph Extraction from Videos},
  author = {Taniya Das and Louis Mahon and Thomas Lukasiewicz},
  journal= {arXiv preprint arXiv:2501.00136},
  year   = {2025}
}

备注

12 pages, To be submitted to a conference