面向艺术品的上下文感知视觉定位
计算机视觉与模式识别
2024-10-17 v1
摘要
许多艺术品收藏包含提供艺术品描述的文本属性,这些属性丰富且具有上下文信息。视觉定位可用于在图像中定位这些描述中的主体,但现有方法在自然图像上训练,难以推广到艺术品领域。本文提出了CIGAr(Context-Infused GroundingDINO for Art),一种利用艺术品描述作为上下文进行训练的视觉定位方法,从而实现对艺术品的视觉定位。此外,我们提出了一个新数据集Ukiyo-eVG,包含手动标注的短语-定位注释,并在两个艺术品数据集上实现了对象检测的新型态。
引用
@article{arxiv.2410.12369,
title = {Context-Infused Visual Grounding for Art},
author = {Selina Khan and Nanne van Noord},
journal= {arXiv preprint arXiv:2410.12369},
year = {2024}
}