中文

利用 ASR 转录与说话人日志的时间戳对齐增强语音情感识别

计算与语言 2025-07-28 v1 声音 音频与语音处理

摘要

本文研究了将自动语音识别(ASR)转录与说话人日志(SD)输出之间的基于时间戳的对齐融入语音情感识别(SER)精度的影响。这两种模态之间的错位通常会降低多模态情感识别系统的可靠性,尤其是在对话语境中。为了解决这个问题,我们引入了一个利用预训练 ASR 和说话人日志模型的对齐流水线,系统地同步时间戳以生成准确标记的说话人片段。我们的多模态方法结合了通过 RoBERTa 提取的文本嵌入和来自 Wav2Vec 的音频嵌入,并利用由门控机制增强的交叉注意力融合。在 IEMOCAP 基准数据集上的实验评估表明,精确的时间戳对齐提高了 SER 精度,优于缺乏同步的基线方法。结果强调了时间对齐的关键重要性,证明了其在提高整体情感识别精度方面的有效性,并为稳健的多模态情感分析提供了基础。

关键词

引用

@article{arxiv.2507.19356,
  title  = {Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization},
  author = {Hsuan-Yu Wang and Pei-Ying Lee and Berlin Chen},
  journal= {arXiv preprint arXiv:2507.19356},
  year   = {2025}
}

备注

6 pages, 3 figures, to appear in the Proceedings of the 2025 International Conference on Asian Language Processing (IALP)