中文

KALE:基于异构图增强的绘品图像描述生成系统

计算机视觉与模式识别 2024-09-18 v1 人工智能

摘要

绘品图像的叙事解读是图像描述中的一个挑战,其目标是生成不仅准确地代表视觉内容,还能深入阐释艺术作品意义的描述。该任务对于绘品图像尤为复杂,因为不同艺术学派与风格下的绘品具有多样的解读方式与审美原则。为此,我们提出了 KALE (Knowledge-Augmented vision-Language model for artwork Elaborations),一种新颖的方法,通过整合绘品元数据作为额外知识来增强现有视觉语言模型。KALE 通过两种方式将元数据纳入模型:首先作为直接的文本输入,其次通过多模态异构知识图。为优化知识图表示的学习,我们引入一种新的跨模态对齐损失,以最大化图像与其对应元数据之间的相似性。实验结果表明,KALE 在多个绘品数据集上实现了优异的性能(尤其在 CIDEr 指标方面),显著优于现有 SOTA 方法。项目源码已公开于 https://github.com/Yanbei-Jiang/Artwork-Interpretation。

关键词

引用

@article{arxiv.2409.10921,
  title  = {KALE: An Artwork Image Captioning System Augmented with Heterogeneous Graph},
  author = {Yanbei Jiang and Krista A. Ehinger and Jey Han Lau},
  journal= {arXiv preprint arXiv:2409.10921},
  year   = {2024}
}

备注

Accepted at IJCAI 2024