中文

WhyAct:在生活方式视频博客中识别动作原因

计算机视觉与模式识别 2021-09-10 v2 计算与语言

摘要

我们旨在自动识别在线视频中的人类动作原因。我们关注广泛存在的生活方式视频博客(vlog)这一体裁,其中人们在执行动作的同时用语言描述这些动作。我们引入并公开了 WhyAct 数据集,该数据集包含 1,077 个手动标注了相应原因的可视动作。我们描述了一种利用视觉与文本信息的多模态模型,用于自动推断视频中所呈现动作对应的原因。

关键词

引用

@article{arxiv.2109.02747,
  title  = {WhyAct: Identifying Action Reasons in Lifestyle Vlogs},
  author = {Oana Ignat and Santiago Castro and Hanwen Miao and Weiji Li and Rada Mihalcea},
  journal= {arXiv preprint arXiv:2109.02747},
  year   = {2021}
}

备注

Accepted at EMNLP 2021