VDialogUE:一种用于视觉 grounding 对话的统一评估基准
计算与语言
2023-09-15 v1 计算机视觉与模式识别
摘要
视觉 grounding 对话系统整合文本与视觉输入等多种交流模态,已成为日益热门的研究领域。然而,缺乏标准化评估框架给衡量该领域进展带来挑战。为此,我们提出 \textbf{VDialogUE},一个用于 \textbf{U} 统一 \textbf{E} 评估的 \textbf{V} 视觉 grounding \textbf{Dialog} 对话基准。它定义了五项核心多模态对话任务并涵盖六个数据集。此外,为全面评估模型在所有任务上的表现,我们开发了一种基于层次分析法(AHP)的新型评估指标,称为VDscore。同时,我们提出了一个简洁而高效的基线模型,名为 \textbf{VISIT}(\textbf{VIS} 视觉 grounding 对话 \textbf{I} \textbf{T} 变换器),以推动通用多模态对话系统的发展。它通过两阶段预训练策略逐步构建其多模态基础与对话能力。我们相信VDialogUE基准及其评估脚本与基线模型将加速视觉 grounding 对话系统的发展,并催生更先进有效的预训练模型。
引用
@article{arxiv.2309.07387,
title = {VDialogUE: A Unified Evaluation Benchmark for Visually-grounded Dialogue},
author = {Yunshui Li and Binyuan Hui and Zhaochao Yin and Wanwei He and Run Luo and Yuxing Long and Min Yang and Fei Huang and Yongbin Li},
journal= {arXiv preprint arXiv:2309.07387},
year = {2023}
}