面向儿童说话人年龄估计的音素时长建模
音频与语音处理
2024-06-19 v1 声音
摘要
从语音中自动推断年龄等重要副语言信息是一个重要的研究领域,具有众多基于口语技术的应用场景。说话人年龄估计在实现个性化以及按年龄适配的信息与内容筛选方面具有应用价值。然而,儿童说话人年龄估计的研究尤其具有挑战性,因为缺乏代表发育谱的相关语音数据,且高信号变异性特别是年龄内变异性使建模复杂化。大多数儿童说话人年龄估计方法直接采用成人语音处理研究中的方法。本文中,我们提出针对儿童的特征,并聚焦于说话人音素时长作为儿童年龄的重要生物标记。我们提出音素时长建模用于从儿童语音预测年龄。为此,首先将儿童语音与对应文本进行强制对齐以导出音素时长分布。从每个音素的音素时长分布计算统计泛函,进而用于训练回归模型以预测说话人年龄。采用两个儿童语音数据集来证明音素时长特征的鲁棒性。我们在从幼儿园到 10 年级儿童的年龄类别上进行了年龄回归实验。实验结果表明音素时长包含儿童重要的发育相关信息。分析并给出了对儿童说话人年龄估计贡献最大的音素。
引用
@article{arxiv.2109.01568,
title = {Phone Duration Modeling for Speaker Age Estimation in Children},
author = {Prashanth Gurunath Shivakumar and Somer Bishop and Catherine Lord and Shrikanth Narayanan},
journal= {arXiv preprint arXiv:2109.01568},
year = {2024}
}