中文

超越无声字母:通过语音细微差别增强 LLM 在情感识别中的应用

计算与语言 2024-12-24 v4 人工智能

摘要

语音中的情感识别是一项具有挑战性的多模态任务,需要同时理解言语内容和语音细微差别。本文提出了一种利用大语言模型(LLMs)进行情感检测的 novel 方法,LLMs 在自然语言理解方面已展现出卓越能力。为克服 LLMs 处理音频输入的固有局限,本文提出了 SpeechCueLLM 方法,该方法将语音特征转化为自然语言描述,使 LLMs 能够通过文本提示执行多模态情感分析而无需任何架构修改。该方法简洁但影响深远,在无需结构修改的情况下优于基线模型。我们在两个数据集上评估了 SpeechCueLLM:IEMOCAP 和 MELD,结果显示情感识别准确率显著提升,特别是在高质量音频数据上。我们还探索了不同特征表示和不同 LLMs 的微调策略的有效性。实验表明,加入语音描述使 IEMOCAP 上的平均加权 F1 分数提升了超过 2%(从 70.111% 提升至 72.596%)。

关键词

引用

@article{arxiv.2407.21315,
  title  = {Beyond Silent Letters: Amplifying LLMs in Emotion Recognition with Vocal Nuances},
  author = {Zehui Wu and Ziwei Gong and Lin Ai and Pengyuan Shi and Kaan Donbekci and Julia Hirschberg},
  journal= {arXiv preprint arXiv:2407.21315},
  year   = {2024}
}