Indian EmoSpeech Command Dataset:一个面向真实场景下基于情感的语音识别的数据集
音频与语音处理
2019-10-31 v1 多媒体
声音
摘要
语音情感分析是一项重要任务,其进一步赋能了若干应用用例。语音话语中的非语言声音在语音情感分析中也起着关键作用。由于智能手机的广泛使用,利用设备端机器学习模型分析通过麦克风捕获的语音命令以理解情感变得可行。非语言信息包括描述周围类型、当前情境与所进行活动的环境背景声音。在本工作中,我们考虑真实场景情感分析中话语内的语言(语音命令)与非语言声音(背景噪声)。我们为此任务创建了一个本土数据集,即“Indian EmoSpeech Command Dataset”。它包含具有多样情感与背景声音的关键词,旨在探索音频分析中的新挑战。我们就多项性能指标,在语音命令情感分析上与各种基线模型进行了详尽比较。我们证明,在语音命令数据集的一个子集上做关键词 spotting 时,我们的方法在 top-one 分数上取得了 3.3% 的显著平均提升。
引用
@article{arxiv.1910.13801,
title = {Indian EmoSpeech Command Dataset: A dataset for emotion based speech recognition in the wild},
author = {Subham Banga and Ujjwal Upadhyay and Piyush Agarwal and Aniket Sharma and Prerana Mukherjee},
journal= {arXiv preprint arXiv:1910.13801},
year = {2019}
}