使用双编码器 Transformer 混合模型从语音信号估计说话人年龄与身高
声音
2022-03-23 v1 机器学习
音频与语音处理
摘要
估计说话人的年龄和身高等特征是一项具有挑战性的任务,在语音取证分析中有众多应用。在本研究中,我们提出了一种用于说话人年龄和身高估计的双编码器 Transformer 混合模型。考虑到男性和女性声音特征(如共振峰和基频差异)的巨大差异,我们提出使用两个独立的 Transformer 编码器来分别提取男性和女性声音的特定语音特征,并使用 wav2vec 2.0 作为通用特征提取器。该架构减少了反向传播过程中的干扰效应,并提高了模型的泛化能力。我们在 TIMIT 数据集上进行了实验,在年龄估计上显著优于当前 SOTA 结果。具体而言,我们在男性和女性年龄估计上分别实现了 5.54 年和 6.49 年的均方根误差(RMSE)。进一步评估不同语音类型对我们任务相对重要性的实验表明,元音是年龄估计中最具区分性的声音。
引用
@article{arxiv.2203.11774,
title = {Estimation of speaker age and height from speech signal using bi-encoder transformer mixture model},
author = {Tarun Gupta and Duc-Tuan Truong and Tran The Anh and Chng Eng Siong},
journal= {arXiv preprint arXiv:2203.11774},
year = {2022}
}
备注
Submitted to Interspeech 2022