中文

面向文化遗产的视觉问答

计算机视觉与模式识别 2020-12-30 v1 计算与语言

摘要

技术与文化遗产的享用正变得日益交织,尤其是随着智能语音导览、虚拟现实与增强现实以及交互式装置的出现。机器学习与计算机视觉是这一持续融合的重要组成部分,使用户与博物馆之间能够实现新的交互模式。尽管如此,与绘画和雕塑互动最频繁的方式仍然是拍照。然而仅凭图像只能传达艺术品的美学,缺乏通常所需以充分理解和欣赏它的信息。通常这些额外知识既来自艺术品本身(因而来自描绘它的图像),也来自外部知识源,例如说明牌。前者可由计算机视觉算法推断,而后者需要更结构化的数据以将视觉内容与相关信息配对。无论其来源如何,该信息仍须有效地传递给用户。计算机视觉中一个新兴的流行趋势是视觉问答(VQA),用户可以通过自然语言提问并与神经网络交互,获得关于视觉内容的回答。我们相信这将是博物馆参观智能语音导览和个人智能手机上简单图像浏览的演进方向。这将把传统的语音导览转变为智能私人讲解员,访客可就其特定兴趣进行提问解释与之互动。其优势有两方面:一方面访客的认知负担将减轻,将信息流限制为用户实际想听的内容;另一方面它提出了与导览交互最自然的方式,有利于参与度。

关键词

引用

@article{arxiv.2003.09853,
  title  = {Visual Question Answering for Cultural Heritage},
  author = {Pietro Bongini and Federico Becattini and Andrew D. Bagdanov and Alberto Del Bimbo},
  journal= {arXiv preprint arXiv:2003.09853},
  year   = {2020}
}

备注

accepted at FlorenceHeritech 2020