DVD:用于视频基础对话中多步推理的诊断数据集
人工智能
2021-06-15 v2 计算与语言
机器学习
摘要
视频基础对话系统需要理解包含轮次间语义依赖的对话,以及包含空间与时间场景变化的视觉线索的视频。构建此类对话系统是一个具有挑战性的问题,涉及对视觉与语言输入的多类推理。现有基准没有足够的标注来透彻分析对话系统并孤立地理解其能力与局限。这些基准也未显式设计以最小化模型可在无实际推理情况下利用的偏差。为应对这些局限,本文提出 DVD,一个用于视频基础对话的诊断数据集(Diagnostic Dataset for Video-grounded Dialogues)。该数据集设计为使偏差最小,并对视频时空空间上不同类型推理有详细标注。对话在多个问题轮次上合成,每轮注入一组跨轮语义关系。我们使用 DVD 分析现有方法,提供对其能力与局限的有趣洞察。总计,DVD 由 个 CATER 合成视频构建,每个视频含 个 10 轮对话实例, resulting in 超过 个对话与 个问答对。我们的代码与数据集公开于 https://github.com/facebookresearch/DVDialogues。
引用
@article{arxiv.2101.00151,
title = {DVD: A Diagnostic Dataset for Multi-step Reasoning in Video Grounded Dialogue},
author = {Hung Le and Chinnadhurai Sankar and Seungwhan Moon and Ahmad Beirami and Alborz Geramifard and Satwik Kottur},
journal= {arXiv preprint arXiv:2101.00151},
year = {2021}
}
备注
20 pages, 14 figures, 8 tables