中文

跨越视觉情感鸿沟:通过学习噪声图像文本对借助文本知识

计算机视觉与模式识别 2025-11-24 v1

摘要

视觉情感识别(VER)是一项长期备受关注的领域,得益于深度神经网络的发展。尽管近期研究通过利用预训练视觉模型中嵌入的知识取得显著进展,但缺乏事实级特征与情感类别之间的直接关联,称为“情感鸿沟”,限制了预训练知识在 VER 任务中的应用。相反,文本模态中明确的情感表达和高信息密度消除了“情感鸿沟”。因此,我们提出从预训练文本模型借助知识,以增强预训练视觉模型的情感感知能力。我们聚焦于社交媒体数据中图像与文本间事实与情感联系,提出分区自适应对比学习(PACL)以充分利用这些联系。具体而言,我们成功分离不同类型样本,并为每种类型设计不同的对比学习策略。通过动态构建负样本和正样本对,充分挖掘噪声样本的潜力。经过大量实验,我们证明跨越“情感鸿沟”显著提升了各种预训练视觉模型在下游情感相关任务上的性能。我们的代码已发布于 https://github.com/wdqqdw/PACL。

关键词

引用

@article{arxiv.2511.17103,
  title  = {Bridging Visual Affective Gap: Borrowing Textual Knowledge by Learning from Noisy Image-Text Pairs},
  author = {Daiqing Wu and Dongbao Yang and Yu Zhou and Can Ma},
  journal= {arXiv preprint arXiv:2511.17103},
  year   = {2025}
}

备注

Accepted by ACM MM 2024