儿童语音的说话人识别
声音
2016-09-27 v1 计算与语言
摘要
本文展示了使用 OGI Kids 语料库以及 GMM-UBM 和 GMM-SVM 说话人识别(SR)系统对儿童语音进行说话人识别的结果。通过对 21 个频带进行 SR 实验,识别了包含儿童重要说话人信息的频谱区域。与成人一样,频谱可分为四个区域,其中第一个(包含主要声道共振信息)和第三个(对应高频语音声音)对 SR 最有用。然而,这些区域出现的频率对于儿童而言高出 11% 至 38%。还注意到,年幼儿童的子带 SR 率较低。最后,展示了识别班级(30 名儿童,年龄相仿)和学校(288 名儿童,年龄各异)中特定儿童的 SR 实验结果。班级表现取决于年龄,准确率从年幼儿童的 90% 到年长儿童的 99% 不等。在学校中识别特定儿童的识别率为 81%。
引用
@article{arxiv.1609.07498,
title = {Speaker Recognition for Children's Speech},
author = {Saeid Safavi and Maryam Najafian and Abualsoud Hanani and Martin J Russell and Peter Jancovic and Michael J Carey},
journal= {arXiv preprint arXiv:1609.07498},
year = {2016}
}
备注
INTERSPEECH 2012, Pages 1836-1839