中文

THAI语情感识别语料库

声音 2025-07-15 v1 音频与语音处理

摘要

我们介绍首个可供泰语语音情感识别使用的语料库,THAI-SER,包含41小时36分钟(27,854段utterances)的录音,来自100次录音,录音环境包括Zoom及两个录音棚。录音包含剧本化和即兴内容,由200名专业演员(112名女性,88名男性,年龄18至55岁)演绎,由专业导演指导。录音时将情感分为五类:中性、愤怒、快乐、悲伤和沮丧。utterances采用众包方式标注情感类别。为控制标注质量,我们设计了严格的过滤与质量控制方案,确保多数一致性得分超过0.71。我们使用两种指标评估标注语料库:注释员间可靠性和人类识别准确率。注释员间可靠性得分为0.692(高于0.667的推荐值),人类识别准确率达到0.772。我们还提供在语料库上训练的模型在原语料库和跨语料库环境下的评估结果。该语料库以Creative Commons BY-SA 4.0许可证公开,实验代码亦随之发布。

关键词

引用

@article{arxiv.2507.09618,
  title  = {THAI Speech Emotion Recognition (THAI-SER) corpus},
  author = {Jilamika Wongpithayadisai and Chompakorn Chaksangchaichot and Soravitt Sangnark and Patawee Prakrankamanant and Krit Gangwanpongpun and Siwa Boonpunmongkol and Premmarin Milindasuta and Dangkamon Na-Pombejra and Sarana Nutanong and Ekapol Chuangsuwanich},
  journal= {arXiv preprint arXiv:2507.09618},
  year   = {2025}
}