基于图链接预测的生活方式视频博客中人类动作共现识别
计算机视觉与模式识别
2024-06-21 v3 计算与语言
计算机与社会
信息检索
摘要
我们提出了自动人类动作共现识别任务,即判断两个人类动作是否能在同一时间间隔内共现。我们创建并公开了 ACE(Action Co-occurrencE,动作共现)数据集,其包含一个由约 12k 个共现视觉动作对及其对应视频片段组成的大规模图。我们描述了利用视觉与文本信息进行图链接预测的模型,以自动推断两个动作是否共现。我们表明,图尤其适合刻画人类动作之间的关系,且所学得的图表示对我们的任务十分有效,并跨不同数据域捕捉到新颖且相关的信息。本文所引入的 ACE 数据集与代码已在 https://github.com/MichiganNLP/vlog_action_co-occurrence 公开。
引用
@article{arxiv.2309.06219,
title = {Human Action Co-occurrence in Lifestyle Vlogs using Graph Link Prediction},
author = {Oana Ignat and Santiago Castro and Weiji Li and Rada Mihalcea},
journal= {arXiv preprint arXiv:2309.06219},
year = {2024}
}