Video2Commonsense:生成常识描述以丰富视频字幕
计算机视觉与模式识别
2023-01-10 v4 计算与语言
摘要
字幕生成是视频理解中一项关键且具有挑战性的任务。在涉及人类等主动智能体的视频中,智能体的动作会引发场景中无数的变化。传统视频字幕反映了可观察到的变化,如场景中物体的移动、操控和变换。与图像不同,视频中的动作也与社会属性固有地相关联,例如意图(为何发生该动作)、效果(动作导致了什么变化)以及描述智能体的属性。因此,对于视频理解,例如为视频生成字幕或回答关于视频的问题时,必须理解这些常识方面。我们提出了首个直接从视频生成常识字幕的工作,以描述意图、效果和属性等潜在方面。我们提出了一个新数据集 "Video-to-Commonsense (V2C)",包含约 9k 个由人类智能体执行各种动作的视频,标注了 3 类常识描述。此外,我们探索了使用开放式基于视频的常识问答(V2C-QA)作为丰富字幕的一种手段。生成任务和问答任务均可用于丰富视频字幕。
引用
@article{arxiv.2003.05162,
title = {Video2Commonsense: Generating Commonsense Descriptions to Enrich Video Captioning},
author = {Zhiyuan Fang and Tejas Gokhale and Pratyay Banerjee and Chitta Baral and Yezhou Yang},
journal= {arXiv preprint arXiv:2003.05162},
year = {2023}
}
备注
EMNLP 2020. V2C Website: https://asu-apg.github.io/Video2Commonsense/