基于距离的软提示学习用于多模态情绪-唤醒估计
计算机视觉与模式识别
2026-03-17 v1
摘要
情绪-唤醒 (VA) 估计对于捕捉自然环境中人类情绪的细微本质至关重要。虽然像 CLIP 这样的预训练视觉语言模型已显示出卓越的语义对齐能力,但其在连续回归任务中的应用常受文本提示离散性质的限制。本文提出了一种用于 VA 估计的新型多模态框架,引入距离感知软提示学习,以桥接语义空间与连续维度之间的差距。具体而言,我们将 VA 空间划分为 3×3 的网格,定义九个情感区域,每个区域关联不同的文本描述。不同于硬性分类,我们采用高斯核函数,基于ground truth坐标与区域中心之间的欧几里得距离计算软标签,使模型能够学习情感过渡的精细细节。对于多模态融合,我们的架构利用 CLIP 图像编码器和 Audio Spectrogram Transformer (AST) 提取稳健的空间与声学特征。这些特征通过门控循环单元 (GRU) 进行时序建模,并通过分层融合方案进行整合,该方案依次结合跨模态注意力进行对齐和门控融合进行自适应细化。在 Aff-Wild2 数据集上的实验结果表明,我们提出的语义引导方法显著提升了 VA 估计的准确度,在不受约束的“野外”场景中实现了具竞争力的性能。
引用
@article{arxiv.2603.13415,
title = {Distance-aware Soft Prompt Learning for Multimodal Valence-Arousal Estimation},
author = {Byeongjin Jung and Chanyeong Park and Sejoon Lim},
journal= {arXiv preprint arXiv:2603.13415},
year = {2026}
}
备注
8pages