基础模型辅助的自动语音情感识别:转写、标注与增强
声音
2023-09-18 v1 音频与语音处理
摘要
利用深度学习模型,语音情感识别(SER)正取得显著进展。尽管如此,训练 SER 系统仍具挑战性,既耗时又耗费资源。与许多其他机器学习任务类似,获取 SER 数据集需要大量的数据标注工作,包括转写与打标签。在尝试扩展常规 SER 系统时,这些标注过程带来了挑战。基础模型的最新进展产生了巨大影响,催生了如 ChatGPT 等应用。这些模型增强了人机交互,包括为 SER 等领域简化数据收集带来独特可能。在本研究中,我们探索使用基础模型辅助实现从转写、标注到增强的 SER 自动化。我们的研究表明,这些模型可生成转写文本以提升仅依赖语音数据的 SER 系统性能。此外,我们注意到从转写语音中标注情感仍是一项艰巨任务。然而,结合多个 LLM 的输出可提升标注质量。最后,我们的发现提示了通过标注无标签语音样本来增强现有语音情感数据集的可行性。
引用
@article{arxiv.2309.08108,
title = {Foundation Model Assisted Automatic Speech Emotion Recognition: Transcribing, Annotating, and Augmenting},
author = {Tiantian Feng and Shrikanth Narayanan},
journal= {arXiv preprint arXiv:2309.08108},
year = {2023}
}
备注
Under review