中文

SEGAA:面向语音的年龄、性别与情感预测统一方法

音频与语音处理 2024-03-05 v1 人工智能 计算与语言 机器学习 声音

摘要

对人类语音的解释在 various applications 中具有重要意义。本研究探索从声学线索预测年龄、性别和情感,这一领域拥有广泛的应用前景。语音分析技术的进步跨越多个领域,从改进客户互动到增强医疗保健和零售体验。辨识情感有助于心理健康,而年龄和性别检测在 various context 中至关重要。探索深度学习模型进行这些预测涉及比较单一模型、多输出模型和顺序模型。数据来源方面,由于数据集选择困难,本文将 CREMA-D 和 EMO-DB 数据集合并。先前工作在单一预测上取得了良好成果,但 limited research 考虑将三者同时处理。本文识别了单一模型方法的缺陷,并提倡我们 novel 的多输出学习架构 Speech-based Emotion Gender and Age Analysis(SEGAA)模型。实验表明,多输出模型在捕捉变量与语音输入之间的复杂关系方面性能与单一模型相当,同时实现了 improved runtime。

关键词

引用

@article{arxiv.2403.00887,
  title  = {SEGAA: A Unified Approach to Predicting Age, Gender, and Emotion in Speech},
  author = {Aron R and Indra Sigicharla and Chirag Periwal and Mohanaprasad K and Nithya Darisini P S and Sourabh Tiwari and Shivani Arora},
  journal= {arXiv preprint arXiv:2403.00887},
  year   = {2024}
}