全连接 CRF 中融合社交网络元数据的深度神经网络用于图像标注
计算机视觉与模式识别
2018-01-30 v1
摘要
我们提出了一种通过融合图像内容描述符与每幅图像的社交媒体上下文来预测图像标签的新方法。上传到 Flickr 等社交媒体站点的图像通常具有有意义的关联信息,例如评论以及该用户上传的其他图像,这些信息补充了像素内容并有助于预测标签。ImageNet~\cite{imagenet_cvpr09} 和 MSCOCO~\cite{LinMBHPRDZ:ECCV14} 等预测挑战赛仅使用像素,而其他方法仅从社交媒体上下文进行预测 \cite{McAuleyECCV12}。我们的方法基于一种新颖的全连接条件随机场 (CRF) 框架,其中每个节点是一幅图像,并由两个深度卷积神经网络 (CNN) 和一个循环神经网络 (RNN) 组成,对文本和视觉节点/图像信息进行建模。CRF 图的边权表示文本相似度以及基于链接的元数据,如用户集合和图像组。我们将 CRF 建模为 RNN 用于学习和推断,并将加权排序损失与交叉熵损失纳入 CRF 参数优化以处理训练数据不平衡问题。我们提出的方法在 MIR-9K 数据集上进行了评估,并在实验上优于当前最先进的方法。
引用
@article{arxiv.1801.09108,
title = {Deep Neural Networks In Fully Connected CRF For Image Labeling With Social Network Metadata},
author = {Chengjiang Long and Roddy Collins and Eran Swears and Anthony Hoogs},
journal= {arXiv preprint arXiv:1801.09108},
year = {2018}
}