利用旋转预测进行自监督学习的图像描述实验
计算机视觉与模式识别
2021-07-29 v1
摘要
图像描述(Image captioning)是人工智能领域中融合计算机视觉与自然语言处理的任务,负责生成描述图像的文字说明,并具有多种应用,例如辅助技术所用的描述或图像索引(如搜索引擎)。这使其成为人工智能中一个备受大量研究关注的关键课题。然而,该任务如同许多其他任务一样,是在通过人工标注的大规模图像上训练的,这可能非常繁琐:需要人力投入、资金与时间成本,容易出错,且在某些情况下(如医学图像)难以执行。为缓解对标注的需求,我们尝试使用自监督学习(self-supervised learning)——一种模型利用图像自身所含数据作为标签的学习方式。尽管该任务具有挑战性,因为它包含两个层面:图像与描述来自两种不同模态,通常由不同类型的网络处理。因此,一个完全自监督的解决方案应是什么样并不明显。它如何以当今自监督应用于图像识别任务的可比方式实现描述生成,仍是一个持续的研究课题。在本项目中,我们采用编码器-解码器架构,其中编码器为在OpenImages数据集上训练的卷积神经网络(CNN),并通过旋转 pretext 任务以自监督方式学习图像特征。解码器为长短期记忆网络(LSTM),它与图像描述模型一同在MS COCO数据集上训练,负责生成描述。我们的GitHub仓库位于:https://github.com/elhagry1/SSL_ImageCaptioning_RotationPrediction
引用
@article{arxiv.2107.13111,
title = {Experimenting with Self-Supervision using Rotation Prediction for Image Captioning},
author = {Ahmed Elhagry and Karima Kadaoui},
journal= {arXiv preprint arXiv:2107.13111},
year = {2021}
}