中文

基于弱标注照片的审美图像描述生成

计算机视觉与模式识别 2019-08-30 v1 计算与语言

摘要

审美图像描述生成(AIC)指为照片生成批判性文本反馈的多模态任务。而在自然图像描述生成(NIC)中,深度模型使用如 MS-COCO 等大型精选数据集以端到端方式训练,AIC 尚无此类大规模干净数据集。为此,我们提出一种自动清洗策略,通过利用摄影网站上易获取的图像与噪声评论来创建基准 AIC 数据集。我们提出一种概率性描述过滤方法以清洗噪声网络数据,并编译了一个大规模干净数据集“AVA-Captions”(230,000 张图像,每图 5 条描述)。此外,通过利用审美属性间的潜在关联,我们提出了一种训练基于卷积神经网络(CNN)的视觉特征提取器(AIC 框架的第一组件)的策略。该策略为弱监督,无需昂贵的真实标注即可有效学习丰富的审美表征。我们最终通过自动指标与主观评估对所述贡献进行了详尽分析。

关键词

引用

@article{arxiv.1908.11310,
  title  = {Aesthetic Image Captioning From Weakly-Labelled Photographs},
  author = {Koustav Ghosal and Aakanksha Rana and Aljosa Smolic},
  journal= {arXiv preprint arXiv:1908.11310},
  year   = {2019}
}

备注

International Workshop on Cross-Modal Learning in Real World, ICCV 2019