中文

AcoustEmo:基于话语感知声学Q-Former的开放词汇情感推理

多媒体 2026-03-24 v1

摘要

多模态大语言模型(MLLMs)在开放词汇情感识别中表现优异,但常忽视细粒度的声学建模。现有方法通常使用全局音频编码器,无法捕捉微细的局部时序动态,如微型韵律和语调变化。为此,我们提出AcoustEmo,一种具有新颖话语感知声学Q-Former的时间敏感型MLLM。该方法利用时间戳同步的滑动窗口动态提取分段音频标记,而非粗糙的全局表示,使模型能够显式追踪微细声学线索的时间演化,并捕捉对话中的深层语境依赖。EMER任务上的实验表明,AcoustEmo显著提升了复杂情感推理能力,超越基线方法,同时保持稳健的语境准确性。

关键词

引用

@article{arxiv.2603.20894,
  title  = {AcoustEmo: Open-Vocabulary Emotion Reasoning via Utterance-Aware Acoustic Q-Former},
  author = {Liyun Zhang and Xuanmeng Sha and Shuqiong Wu and Fengkai Liu},
  journal= {arXiv preprint arXiv:2603.20894},
  year   = {2026}
}

备注

6 pages