中文

基于图链接预测的生活方式视频博客中人类动作共现识别

计算机视觉与模式识别 2024-06-21 v3 计算与语言 计算机与社会 信息检索

摘要

我们提出了自动人类动作共现识别任务,即判断两个人类动作是否能在同一时间间隔内共现。我们创建并公开了 ACE(Action Co-occurrencE,动作共现)数据集,其包含一个由约 12k 个共现视觉动作对及其对应视频片段组成的大规模图。我们描述了利用视觉与文本信息进行图链接预测的模型,以自动推断两个动作是否共现。我们表明,图尤其适合刻画人类动作之间的关系,且所学得的图表示对我们的任务十分有效,并跨不同数据域捕捉到新颖且相关的信息。本文所引入的 ACE 数据集与代码已在 https://github.com/MichiganNLP/vlog_action_co-occurrence 公开。

关键词

引用

@article{arxiv.2309.06219,
  title  = {Human Action Co-occurrence in Lifestyle Vlogs using Graph Link Prediction},
  author = {Oana Ignat and Santiago Castro and Weiji Li and Rada Mihalcea},
  journal= {arXiv preprint arXiv:2309.06219},
  year   = {2024}
}