中文

开放词汇视频关系抽取

计算机视觉与模式识别 2023-12-27 v1

摘要

对视频的全面理解离不开用上下文动作-对象交互来描述动作。然而,许多当前的视频理解任务优先考虑通用动作分类,而忽略了塑造动作本质的参与者和关系,导致对动作的浅层理解。受此启发,我们引入了开放词汇视频关系抽取(OVRE),这是一个新颖的任务,通过以动作为中心的关系三元组来审视动作理解。OVRE关注参与动作的成对关系,并用自然语言描述这些关系三元组。此外,我们策划了Moments-OVRE数据集,包含18万个带有以动作为中心的关系三元组的视频,源自一个多标签动作分类数据集。利用Moments-OVRE,我们进一步提出了一个跨模态映射模型来生成关系三元组序列。最后,我们在新的OVRE任务上对现有的跨模态生成模型进行了基准测试。

关键词

引用

@article{arxiv.2312.15670,
  title  = {Open-Vocabulary Video Relation Extraction},
  author = {Wentao Tian and Zheng Wang and Yuqian Fu and Jingjing Chen and Lechao Cheng},
  journal= {arXiv preprint arXiv:2312.15670},
  year   = {2023}
}

备注

accpeted by AAAI 2024