中文

通过注意力池化实现可解释的语音情感识别:基于注意力的时间定位的见解

声音 2025-06-23 v1 音频与语音处理

摘要

用于语音情感识别(SER)的最先进 Transformer 模型依赖于时间特征聚合,但高级池化方法仍未得到充分探索。我们系统地对池化策略进行了基准测试,包括多查询多头注意力统计池化,与平均池化相比,该方法实现了 3.5 个百分点的宏 F1 提升。注意力分析表明,15% 的帧捕获了 80% 的情感线索,揭示了情感信息的局部化模式。对高注意力帧的分析表明,非语言发声和过度清晰发音的音素在池化过程中被不成比例地优先考虑,反映了人类的感知策略。我们的研究结果将注意力池化定位为一种高性能的 SER 机制和一种具有生物学合理性的可解释情感定位工具。在 Interspeech 2025 自然条件下语音情感识别挑战赛上,我们的方法获得了 0.3649 的宏 F1 分数。

关键词

引用

@article{arxiv.2506.15754,
  title  = {Explainable speech emotion recognition through attentive pooling: insights from attention-based temporal localization},
  author = {Tahitoa Leygue and Astrid Sabourin and Christian Bolzmacher and Sylvain Bouchigny and Margarita Anastassova and Quoc-Cuong Pham},
  journal= {arXiv preprint arXiv:2506.15754},
  year   = {2025}
}