文化遗产文物的多模态元数据分配
计算机视觉与模式识别
2024-06-04 v1 机器学习
摘要
我们使用晚期融合方法为文化遗产领域开发了一个多模态分类器,并引入了一个新颖的数据集。三种模态是图像、文本和表格数据。我们将图像分类器基于ResNet卷积神经网络架构,文本分类器基于多语言Transformer架构(XML-Roberta)。两者都作为多任务分类器训练,并使用焦点损失来处理类别不平衡。表格数据和晚期融合由梯度树提升处理。我们还展示了如何利用知识图谱中的特定数据模型和分类法来创建数据集并存储分类结果。所有单个分类器都能准确预测数字化丝绸制品中缺失的属性,其中多模态方法提供了最佳结果。
引用
@article{arxiv.2406.00423,
title = {Multimodal Metadata Assignment for Cultural Heritage Artifacts},
author = {Luis Rei and Dunja Mladenić and Mareike Dorozynski and Franz Rottensteiner and Thomas Schleider and Raphaël Troncy and Jorge Sebastián Lozano and Mar Gaitán Salvatella},
journal= {arXiv preprint arXiv:2406.00423},
year = {2024}
}