中文

大语言模型能否辅助标注语音情感数据?揭示新前沿

声音 2024-06-21 v3 音频与语音处理

摘要

尽管语音情感识别(SER)模型近期取得进展,但最先进的深度学习(DL)方法面临标注数据可用性有限的挑战。大语言模型(LLMs)革新了我们对自然语言的理解,引入了拓宽语言、语音与视觉理解的涌现属性。本文考察 LLMs 标注丰富语音数据的潜力,旨在提升 SER 的当前最优水平。我们在多种设置下使用公开可用的语音情感分类数据集评估该能力。借助 ChatGPT,我们通过实验展示了 LLMs 在语音情感数据标注中的 promising 作用。我们的评估涵盖单样本与少样本场景,揭示了 SER 中的性能变异性。值得注意的是,我们通过数据增强将 ChatGPT 标注样本并入现有数据集,取得了改进结果。我们的工作揭示了语音情感分类的新前沿,凸显了 LLMs 在该领域日益增强的重要性。

关键词

引用

@article{arxiv.2307.06090,
  title  = {Can Large Language Models Aid in Annotating Speech Emotional Data? Uncovering New Frontiers},
  author = {Siddique Latif and Muhammad Usama and Mohammad Ibrahim Malik and Björn W. Schuller},
  journal= {arXiv preprint arXiv:2307.06090},
  year   = {2024}
}

备注

Accepted in IEEE Computational Intelligence Magazine