VILA:利用视觉-语言预训练从用户评论中学习图像美学
计算机视觉与模式识别
2023-06-06 v2
摘要
评估图像美学具有挑战性,因为它受构图、色彩、风格及高层语义等多因素影响。现有图像美学评估(IAA)方法主要依赖人工标注的评分分数,这过度简化了人类感知的视觉美学信息。相反,用户评论提供了更全面的信息,是表达人类对图像美学意见与偏好的更自然方式。有鉴于此,我们提出从用户评论中学习图像美学,并探索视觉-语言预训练方法以学习多模态美学表征。具体而言,我们使用图像-评论对预训练一个图像-文本编码器-解码器模型,采用对比与生成目标,在无人工标签情况下学习丰富而通用的美学语义。为高效适配预训练模型至下游 IAA 任务,我们进一步提出轻量级基于排序的适配器,以文本为锚点学习美学排序概念。结果表明,我们的预训练美学视觉-语言模型在 AVA-Captions 数据集上的图像美学描述优于先前工作,并对零样本风格分类与零样本 IAA 等美学任务具备强大零样本能力,超越许多有监督基线。仅使用所提适配器模块微调极少参数,我们的模型在 AVA 数据集上取得了最先进的 IAA 性能。
引用
@article{arxiv.2303.14302,
title = {VILA: Learning Image Aesthetics from User Comments with Vision-Language Pretraining},
author = {Junjie Ke and Keren Ye and Jiahui Yu and Yonghui Wu and Peyman Milanfar and Feng Yang},
journal= {arXiv preprint arXiv:2303.14302},
year = {2023}
}
备注
CVPR 2023, https://github.com/google-research/google-research/tree/master/vila