PERSONA:一种用于情绪识别、性别识别和年龄估计的应用
音频与语音处理
2024-06-12 v1 声音
摘要
情绪识别(ER)、性别识别(GR)和年龄估计(AE)构成了副语言任务,这些任务不依赖于口语内容,而主要依赖于语音特征,如音高和语调。尽管先前的研究在分别为每个任务开发模型方面取得了显著进展,但尽管这些任务具有内在的相互关联性,同时学习这些任务的研究相对较少。因此,在本演示中,我们介绍了PERSONA,这是一个在后台使用单一模型预测ER、GR和AE的应用。值得注意的一点是,我们通过进行比较研究表明,来自说话人识别预训练模型(PTM)的表征比最先进的(SOTA)自监督(SSL)PTM更适合这种多任务学习格式。我们的方法避免了为每个任务部署单独模型的需要,并可能在训练和部署阶段节省资源和时间。
引用
@article{arxiv.2406.06781,
title = {PERSONA: An Application for Emotion Recognition, Gender Recognition and Age Estimation},
author = {Devyani Koshal and Orchid Chetia Phukan and Sarthak Jain and Arun Balaji Buduru and Rajesh Sharma},
journal= {arXiv preprint arXiv:2406.06781},
year = {2024}
}
备注
Accepted to INTERSPEECH 2024 Show & Tell Demonstrations