WhyAct:在生活方式视频博客中识别动作原因
计算机视觉与模式识别
2021-09-10 v2 计算与语言
摘要
我们旨在自动识别在线视频中的人类动作原因。我们关注广泛存在的生活方式视频博客(vlog)这一体裁,其中人们在执行动作的同时用语言描述这些动作。我们引入并公开了 WhyAct 数据集,该数据集包含 1,077 个手动标注了相应原因的可视动作。我们描述了一种利用视觉与文本信息的多模态模型,用于自动推断视频中所呈现动作对应的原因。
引用
@article{arxiv.2109.02747,
title = {WhyAct: Identifying Action Reasons in Lifestyle Vlogs},
author = {Oana Ignat and Santiago Castro and Hanwen Miao and Weiji Li and Rada Mihalcea},
journal= {arXiv preprint arXiv:2109.02747},
year = {2021}
}
备注
Accepted at EMNLP 2021