VSTAR:一个面向具有场景与主题转换的情境语义理解的视频依据对话数据集
计算机视觉与模式识别
2023-05-31 v1 计算与语言
摘要
视频依据对话理解是一项具有挑战性的问题,要求机器对从弱对齐视频与对话中提取的情境语义进行感知、解析与推理。现有多数基准将该任务视为与帧无关的视觉理解任务同等对待两种模态,而忽视了多模态对话中的内在属性,如场景与主题转换。本文提出 Video-grounded Scene&Topic AwaRe dialogue (VSTAR) 数据集,一个基于 395 部电视剧的大规模视频依据对话理解数据集。基于 VSTAR,我们提出两个视频依据对话理解基准:场景分割与主题分割,以及一个视频依据对话生成基准。我们在这些基准上进行了综合实验,以展示多模态信息与片段在视频依据对话理解与生成中的重要性。
引用
@article{arxiv.2305.18756,
title = {VSTAR: A Video-grounded Dialogue Dataset for Situated Semantic Understanding with Scene and Topic Transitions},
author = {Yuxuan Wang and Zilong Zheng and Xueliang Zhao and Jinpeng Li and Yueqian Wang and Dongyan Zhao},
journal= {arXiv preprint arXiv:2305.18756},
year = {2023}
}
备注
To appear at ACL 2023