面向视觉艺术理解的小型情感视觉语言模型训练
计算机视觉与模式识别
2024-07-11 v2
摘要
本文开发小型视觉语言模型以理解视觉艺术,即在给定一件艺术品时,旨在识别其情感类别并用自然语言解释该预测。尽管小型模型计算高效,但其容量相比大型模型受限很多。为打破这一权衡,本文通过情感建模与输入-输出特征对齐构建了一个小型情感视觉语言模型(SEVLM)。一方面,基于心理学专家标注的效价-唤醒度-支配度(VAD)知识,我们引入并融合了通过 VAD 词典和 VAD 头导出的情感特征,以对齐预测情感解释与真实值的 VAD 向量。与仅使用传统文本嵌入相比,这使视觉语言模型能够更好地理解和生成情感文本。另一方面,我们设计了一个对比头以拉近图像、其情感类别及解释的嵌入,从而对齐模型输出与输入。在两个公开的情感解释数据集上,我们表明所提技术持续提升了基线 SEVLM 的视觉艺术理解性能。重要的是,所提模型可在单块 RTX 2080 Ti 上进行训练和评估,同时表现出极强的性能:它不仅优于最先进的小型模型,而且与微调后的 LLaVA 7B 及 GPT4(V) 相比也具竞争力。代码可在 https://github.com/BetterZH/SEVLM-code 获取。
关键词
引用
@article{arxiv.2403.11150,
title = {Training A Small Emotional Vision Language Model for Visual Art Comprehension},
author = {Jing Zhang and Liang Zheng and Meng Wang and Dan Guo},
journal= {arXiv preprint arXiv:2403.11150},
year = {2024}
}
备注
16 pages