中文

VILA:利用视觉-语言预训练从用户评论中学习图像美学

计算机视觉与模式识别 2023-06-06 v2

摘要

评估图像美学具有挑战性,因为它受构图、色彩、风格及高层语义等多因素影响。现有图像美学评估(IAA)方法主要依赖人工标注的评分分数,这过度简化了人类感知的视觉美学信息。相反,用户评论提供了更全面的信息,是表达人类对图像美学意见与偏好的更自然方式。有鉴于此,我们提出从用户评论中学习图像美学,并探索视觉-语言预训练方法以学习多模态美学表征。具体而言,我们使用图像-评论对预训练一个图像-文本编码器-解码器模型,采用对比与生成目标,在无人工标签情况下学习丰富而通用的美学语义。为高效适配预训练模型至下游 IAA 任务,我们进一步提出轻量级基于排序的适配器,以文本为锚点学习美学排序概念。结果表明,我们的预训练美学视觉-语言模型在 AVA-Captions 数据集上的图像美学描述优于先前工作,并对零样本风格分类与零样本 IAA 等美学任务具备强大零样本能力,超越许多有监督基线。仅使用所提适配器模块微调极少参数,我们的模型在 AVA 数据集上取得了最先进的 IAA 性能。

关键词

引用

@article{arxiv.2303.14302,
  title  = {VILA: Learning Image Aesthetics from User Comments with Vision-Language Pretraining},
  author = {Junjie Ke and Keren Ye and Jiahui Yu and Yonghui Wu and Peyman Milanfar and Feng Yang},
  journal= {arXiv preprint arXiv:2303.14302},
  year   = {2023}
}

备注

CVPR 2023, https://github.com/google-research/google-research/tree/master/vila