面向影视节目的基于语音的情感识别系统集成框架
音频与语音处理
2018-03-06 v1 声音
摘要
在人工智能(AI)产品中采用基于语音的情感识别功能将改善用户体验。已完成的大多数研究仅关注受控条件下采集的语音。这些研究中所评估的场景均被良好控制。当存在背景噪声或非语音填充音时,常规方法可能失效。本文提出一种结合音频多方面特征的集成框架。该框架依托多任务学习融入性别与说话人信息,因此能够尽可能挖掘并捕获情感信息。该框架在多模态情感挑战赛(MEC)2017 语料库上进行了评估,该语料库接近真实世界。所提框架相对最佳基线系统取得了 29.5% 的提升(相对改进)。
引用
@article{arxiv.1803.01122,
title = {An Ensemble Framework of Voice-Based Emotion Recognition System for Films and TV Programs},
author = {Fei Tao and Gang Liu and Qingen Zhao},
journal= {arXiv preprint arXiv:1803.01122},
year = {2018}
}