中文

面向艺术品的上下文感知视觉定位

计算机视觉与模式识别 2024-10-17 v1

摘要

许多艺术品收藏包含提供艺术品描述的文本属性,这些属性丰富且具有上下文信息。视觉定位可用于在图像中定位这些描述中的主体,但现有方法在自然图像上训练,难以推广到艺术品领域。本文提出了CIGAr(Context-Infused GroundingDINO for Art),一种利用艺术品描述作为上下文进行训练的视觉定位方法,从而实现对艺术品的视觉定位。此外,我们提出了一个新数据集Ukiyo-eVG,包含手动标注的短语-定位注释,并在两个艺术品数据集上实现了对象检测的新型态。

关键词

引用

@article{arxiv.2410.12369,
  title  = {Context-Infused Visual Grounding for Art},
  author = {Selina Khan and Nanne van Noord},
  journal= {arXiv preprint arXiv:2410.12369},
  year   = {2024}
}