中文

ABHINAYA -- 用于自然语言情境下语音情感识别的系统

声音 2025-05-27 v1 人工智能 音频与语音处理

摘要

在自然语言情境下的语音情感识别(SER)仍是一个挑战,由于内在变异性、多样化的录音条件以及类别不平衡。作为参赛者之一,我们针对这些复杂问题提出了 Abhinaya 系统,该系统集成了语音基、文本基和语音-文本模型。我们的方法对自监督语音大语言模型(SLLM)进行微调以获取语音表征,利用大语言模型(LLM)获取文本上下文,并采用 SLLM 进行语音-文本建模以捕捉细微情感线索。为缓解类别不平衡,我们应用特定的损失函数并通过多数投票生成类别决策。尽管该系统中有一个模型未完全训练,Abhinaya 系统仍在 166 个提交项目中排名第 4。训练完成后,它实现了已发布结果中的最先进性能,表明了该方法在现实条件下对 SER 有效。

关键词

引用

@article{arxiv.2505.18217,
  title  = {ABHINAYA -- A System for Speech Emotion Recognition In Naturalistic Conditions Challenge},
  author = {Soumya Dutta and Smruthi Balaji and Varada R and Viveka Salinamakki and Sriram Ganapathy},
  journal= {arXiv preprint arXiv:2505.18217},
  year   = {2025}
}

备注

5 pages, 2 figures, 4 tables, accepted at Interspeech 2025