基于弱标注照片的审美图像描述生成
计算机视觉与模式识别
2019-08-30 v1 计算与语言
摘要
审美图像描述生成(AIC)指为照片生成批判性文本反馈的多模态任务。而在自然图像描述生成(NIC)中,深度模型使用如 MS-COCO 等大型精选数据集以端到端方式训练,AIC 尚无此类大规模干净数据集。为此,我们提出一种自动清洗策略,通过利用摄影网站上易获取的图像与噪声评论来创建基准 AIC 数据集。我们提出一种概率性描述过滤方法以清洗噪声网络数据,并编译了一个大规模干净数据集“AVA-Captions”(230,000 张图像,每图 5 条描述)。此外,通过利用审美属性间的潜在关联,我们提出了一种训练基于卷积神经网络(CNN)的视觉特征提取器(AIC 框架的第一组件)的策略。该策略为弱监督,无需昂贵的真实标注即可有效学习丰富的审美表征。我们最终通过自动指标与主观评估对所述贡献进行了详尽分析。
引用
@article{arxiv.1908.11310,
title = {Aesthetic Image Captioning From Weakly-Labelled Photographs},
author = {Koustav Ghosal and Aakanksha Rana and Aljosa Smolic},
journal= {arXiv preprint arXiv:1908.11310},
year = {2019}
}
备注
International Workshop on Cross-Modal Learning in Real World, ICCV 2019