面向多模态贺卡数据集的弱监督标注
计算机视觉与模式识别
2022-12-05 v1 人工智能
摘要
近年来,在大规模语料上预训练并在分类多模态数据集等多种任务上表现良好的预训练模型数量不断增长。这些模型在自然图像上展现了良好性能,但在图像中稀缺的抽象概念方面尚未得到充分探索。在本工作中,我们引入了一个基于图像/文本的、具有抽象视觉概念的数据集,称为贺卡数据集(GCD)。在我们的工作中,我们提议聚合预训练图像与文本嵌入的特征,以从 GCD 中学习抽象视觉概念。这使我们能够学习文本修饰的图像特征,将来自多模态数据流的补余与冗余信息融合为单一且有意义的表征。其次,GCD 数据集的说明文字由基于 CLIP 的预训练图像描述模型生成。最后,我们还证明了所提出的数据集也可用于利用预训练文本到图像生成模型来生成贺卡图像。
引用
@article{arxiv.2212.00847,
title = {Weakly Supervised Annotations for Multi-modal Greeting Cards Dataset},
author = {Sidra Hanif and Longin Jan Latecki},
journal= {arXiv preprint arXiv:2212.00847},
year = {2022}
}
备注
Accepted for poster presentation at Pretrain@WACV 2023