中文

从五分钟语音样本中自动检测表达性情绪:挑战与机遇

声音 2022-04-01 v1 机器学习 音频与语音处理

摘要

我们提出了一项关于表达性情绪(Expressed Emotion, EE)自动识别的新可行性研究,EE是一种基于照料者自由谈论其亲属/家庭成员的家庭环境概念。我们描述了一种自动化方法,用于从37个录音访谈样本中获取的声学与文本特征中确定EE的关键组成部分——温暖程度。这些录制于20多年前的录音源自2,232名英国双胞胎儿童的国家代表性出生队列,并经过人工EE编码。我们概述了从音频质量高度多变的录音中提取可用信息的核心步骤,并评估了使用不同声学与文本特征组合训练的四种机器学习方法的效果。尽管处理这些历史数据存在挑战,我们证明了温暖程度可被预测,其F1F_{1}分数为\textbf{61.5\%}。在本文中,我们总结了经验并为未来使用真实世界语音样本的工作提供建议。

关键词

引用

@article{arxiv.2203.17242,
  title  = {Automatic Detection of Expressed Emotion from Five-Minute Speech Samples: Challenges and Opportunities},
  author = {Bahman Mirheidari and André Bittar and Nicholas Cummins and Johnny Downs and Helen L. Fisher and Heidi Christensen},
  journal= {arXiv preprint arXiv:2203.17242},
  year   = {2022}
}

备注

Submitted to Interspeech 2022