利用多模态深度神经网络解耦语言与视觉美学
计算机视觉与模式识别
2024-11-01 v1 计算与语言
摘要
当我们体验视觉刺激为美时,这种体验有多少来自我们无法描述的感知计算,又有多少来自我们可以 readily 转化为自然语言的概念知识?通过行为范式或神经成像来解耦视觉诱发的情感与审美体验中的感知与语言,在经验上往往难以处理。为此,我们绕过这一挑战,利用对单模态视觉、单模态语言和多模态(语言对齐)深度神经网络(DNN)模型所学表示的线性解码,来预测自然图像的人类美感评分。我们表明单模态视觉模型(如 SimCLR)解释了这些评分中绝大部分的可解释方差。语言对齐视觉模型(如 SLIP)相对于单模态视觉仅有小幅提升。单模态语言模型(如 GPT2)以视觉嵌入为条件通过 CLIPCap 生成标题,没有带来进一步提升。仅标题嵌入的预测准确度低于图像和标题嵌入拼接后的预测。综合来看,这些结果表明,无论我们最终找到何种词语来描述审美体验,前馈感知的不可言说计算可能已为该体验提供了充分基础。
引用
@article{arxiv.2410.23603,
title = {Using Multimodal Deep Neural Networks to Disentangle Language from Visual Aesthetics},
author = {Colin Conwell and Christopher Hamblin and Chelsea Boccagno and David Mayo and Jesse Cummings and Leyla Isik and Andrei Barbu},
journal= {arXiv preprint arXiv:2410.23603},
year = {2024}
}