中文

基于同步多视角日常活动视频的 VHAKG 多模态知识图谱

人工智能 2024-08-29 v2 计算与语言 计算机视觉与模式识别

摘要

多模态知识图谱(MMKG)通过将各种非符号数据(如图像和视频)嵌入符号系统,已引起广泛关注,旨在实现跨模态的知识处理和机器学习。然而,针对由多个事件组成的视频(如日常活动)构建 MMKG 的工作仍处于早期阶段。本文基于同步多视角日常活动模拟视频构建了一个 MMKG。除了将日常生活视频内容表示为事件中心知识外,我们的 MMKG 还包括帧级细粒度变化,如视频帧内的边界框。此外,我们提供了查询该 MMKG 的支持工具。作为应用示例,我们演示了我们的 MMKG 通过提供针对特定任务所需的视觉-语言数据集,促进了视觉-语言模型的基准测试。

关键词

引用

@article{arxiv.2408.14895,
  title  = {VHAKG: A Multi-modal Knowledge Graph Based on Synchronized Multi-view Videos of Daily Activities},
  author = {Shusaku Egami and Takahiro Ugai and Swe Nwe Nwe Htun and Ken Fukuda},
  journal= {arXiv preprint arXiv:2408.14895},
  year   = {2024}
}

备注

5 pages, 4 figures, accepted by CIKM2024 Resource Track