基于分形维数模式的多分辨率分析用于人物依赖音频情感识别的粗略估计
人工智能
2016-12-05 v2 机器学习
声音
摘要
作为一种通用的表达方式,音频分析与识别因其在现实世界中的广泛应用而备受关注。音频情感识别(AER)试图通过给定的语音信号理解人类的情感状态,并因其在友好的人机界面方面的进一步发展而在国内外得到研究。与其他现有工作不同,本文研究了人物依赖的音频情感模式,并计算分形维数特征用于声学特征提取。此外,该方法能够高效地学习听觉情感的内在特性,同时从各子带的分形维数中学习语音特征。实验结果表明,所提出的方法能够为音频情感识别提供具有竞争力的性能。
引用
@article{arxiv.1607.00087,
title = {Fractal Dimension Pattern Based Multiresolution Analysis for Rough Estimator of Person-Dependent Audio Emotion Recognition},
author = {Miao Cheng and Ah Chung Tsoi},
journal= {arXiv preprint arXiv:1607.00087},
year = {2016}
}