视觉-语言模型在个人化图像审美评估中编码了什么?
计算机视觉与模式识别
2026-04-14 v1 计算与语言
摘要
个人化图像审美评估 (PIAA) 是一个具有实际应用价值的研究问题。尽管基于视觉-语言模型 (VLM) 的方法是 PIAA 的有前景的候选者,但它们内部是否编码了有效进行个性化所必需的丰富、多层次审美属性仍不清楚。本文首先分析 VLM 的内部表征,以检验此类审美属性的存在与分布,然后利用这些表征进行轻量级、individual-level 的个性化,不需要模型微调。我们的分析表明,VLM 编码了多样化的审美属性,这些属性会传递到语言解码器层中。基于这些表征,我们展示简单线性模型可有效进行 PIAA。我们进一步分析了审美信息在不同 VLM 架构中不同层之间的传递方式以及跨图像域的传递。我们的发现提供了关于 VLM 如何用于建模主观、individual 审美偏好的见解。我们的代码可在 https://github.com/ynklab/vlm-latent-piaa 上获取。
引用
@article{arxiv.2604.11374,
title = {What Do Vision-Language Models Encode for Personalized Image Aesthetics Assessment?},
author = {Koki Ryu and Hitomi Yanaka},
journal= {arXiv preprint arXiv:2604.11374},
year = {2026}
}
备注
To appear at ACL 2026 findings