GPT-3是否为文化遗产视觉问答所需的全部?
计算机视觉与模式识别
2023-05-22 v2 计算与语言
摘要
近年来,深度学习和计算机视觉在文化遗产领域的应用变得高度相关,出现了许多关于音频智能导览、交互式博物馆和增强现实的应用。所有这些技术都需要大量数据才能有效工作并对用户有用。在艺术品语境下,此类数据由专家以昂贵且耗时的过程进行标注。特别地,对于每件艺术品,必须收集其图像和描述表才能执行如视觉问答之类的常见任务。本文中,我们提出一种视觉问答方法,可在运行时生成描述表,用于回答关于艺术品的视觉与语境问题,完全避免图像与标注过程。为此,我们探究使用GPT-3为艺术品生成描述,并通过图像描述指标分析生成描述的质量。最后我们评估了视觉问答与图像描述任务的性能。
引用
@article{arxiv.2207.12101,
title = {Is GPT-3 all you need for Visual Question Answering in Cultural Heritage?},
author = {Pietro Bongini and Federico Becattini and Alberto Del Bimbo},
journal= {arXiv preprint arXiv:2207.12101},
year = {2023}
}