ConvGenVisMo:对话式生成视觉模型评估
计算机视觉与模式识别
2023-05-30 v1 人工智能
摘要
对话式生成视觉模型(CGVM),如 Visual ChatGPT(Wu et al., 2023),近期由计算机视觉与自然语言处理技术的融合而生。这些模型使人机之间更自然、交互式的交流成为可能,因为它们能理解用户的语言输入并以自然语言连同视觉输出生成回应。为就这些模型的使用与部署做出明智决策,通过合适的评估框架在真实数据集上分析其性能十分重要。本文中,我们提出 ConvGenVisMo,一个用于评估 CGVM 这一新任务的框架。ConvGenVisMo 引入了该任务的一个新基准评估数据集,并提供一套已有与全新的自动化评估指标以评估输出。所有 ConvGenVisMo 资源,包括数据集与评估代码,将在 GitHub 上公开。
引用
@article{arxiv.2305.17784,
title = {ConvGenVisMo: Evaluation of Conversational Generative Vision Models},
author = {Narjes Nikzad Khasmakhi and Meysam Asgari-Chenaghlu and Nabiha Asghar and Philipp Schaer and Dietlind Zühlke},
journal= {arXiv preprint arXiv:2305.17784},
year = {2023}
}