中文

基于扩散的文化遗产图像描述与检索数据增强

计算机视觉与模式识别 2024-08-20 v1

摘要

文化遗产应用与先进的机器学习模型正在形成富有成效的协同效应,以提供有效且便捷的方式与艺术品进行交互。智能语音导览、个性化艺术相关内容和游戏化方法只是如何利用技术为艺术家或展览提供附加价值的几个例子。然而,从机器学习的角度来看,可用的艺术数据量往往不足以训练出有效的模型。现成的计算机视觉模块在一定程度上仍可被利用,但艺术图像与用于训练此类模型的标准自然图像数据集之间存在严重的域偏移。因此,这可能导致性能下降。本文提出了一种新颖的方法,以应对文化遗产领域中标注数据有限和域偏移的挑战。通过利用生成式视觉-语言模型,我们基于艺术品的文本描述生成多样的艺术品变体,从而增强艺术数据集。该增强策略提升了数据集的多样性,弥合了自然图像与艺术品之间的差距,并改善了视觉线索与通用数据集知识之间的对齐。生成的变体有助于训练能够更深入理解艺术特征、并能够使用恰当术语生成更好描述的视觉与语言模型。

关键词

引用

@article{arxiv.2308.07151,
  title  = {Diffusion Based Augmentation for Captioning and Retrieval in Cultural Heritage},
  author = {Dario Cioni and Lorenzo Berlincioni and Federico Becattini and Alberto del Bimbo},
  journal= {arXiv preprint arXiv:2308.07151},
  year   = {2024}
}

备注

Accepted at ICCV 2023 4th Workshop on e-Heritage