基于多尺度文本引导自监督学习的综合美学洞察推进
计算机视觉与模式识别
2024-12-17 v1 人工智能
机器学习
摘要
图像美学评估(IAA)是一项重要且复杂的任务,需要分析和评估图像的美学价值,并识别其亮点和需要改进的地方。传统的 IAA 方法通常集中于单一美学任务,且受限于标注数据集的不足,从而妨碍了深入的美学理解。尽管通过应用多模态大语言模型(MLLM)来克服这一挑战已有努力,但此类模型对于 IAA 目的而言仍不够成熟。为了解决这一问题,我们提出了一种能够提供细腻美学洞察的综合美学 MLLM。我们方法的核心是一种创新的多尺度文本引导自监督学习技术。该技术具有一个多尺度特征对齐模块,并以自监督方式利用大量未标记数据,在结构和功能上增强美学能力。实证证据表明,伴随广泛的指令微调,我们的模型在包括美学评分、美学评论和个性化图像美学评估在内的多个任务上确立了新的 SOTA 基准。值得注意的是,它还在新兴的美学建议任务中展示了零样本学习能力。此外,对于个性化图像美学评估,我们利用了上下文学习的潜力并展示了其固有优势。
引用
@article{arxiv.2412.11952,
title = {Advancing Comprehensive Aesthetic Insight with Multi-Scale Text-Guided Self-Supervised Learning},
author = {Yuti Liu and Shice Liu and Junyuan Gao and Pengtao Jiang and Hao Zhang and Jinwei Chen and Bo Li},
journal= {arXiv preprint arXiv:2412.11952},
year = {2024}
}
备注
Accepted by AAAI 2025