中文

利用社交网络中视觉与文本特征关系进行零样本深度学习图像分类

计算机视觉与模式识别 2021-07-09 v1 人工智能

摘要

与无监督机器学习相关的主要问题之一是从大型数据集中处理并提取有用信息的成本。本工作中,我们提出一种基于 CLIP 神经网络架构在多模态环境(图像与文本)中可迁移学习能力的分类器集成,数据来自社交媒体。为此,我们使用 InstaNY100K 数据集,并提出了一种基于采样技术的验证方法。我们的实验基于依据 Places 数据集标签的图像分类任务,先仅考虑视觉部分,再添加关联文本作为支持。所得结果表明,如 CLIP 的已训练神经网络可经少量微调成功应用于图像分类,且根据目标不同,考虑图像关联文本有助于提升准确率。结果展示了一个看似有前景的研究方向。

关键词

引用

@article{arxiv.2107.03751,
  title  = {Exploiting the relationship between visual and textual features in social networks for image classification with zero-shot deep learning},
  author = {Luis Lucas and David Tomas and Jose Garcia-Rodriguez},
  journal= {arXiv preprint arXiv:2107.03751},
  year   = {2021}
}