婴儿与成人发声声学的低维表示
音频与语音处理
2022-04-27 v1 计算与语言
机器学习
声音
摘要
在生命的最初几年,婴儿发声发生显著变化,随着婴儿发展出使其能够发出语音的发声技能。基于特定声学特征、原语音类别或音素转写的刻画能够提供一种对不同年龄与情境下婴儿所发声音的代表,但未能充分描述听者如何感知声音,在大尺度上获取效率低,且不经额外统计处理难以在二维中可视化。基于机器学习的方法提供了用纯数据驱动的婴儿声音表示补充这些刻画的机会。在此,我们利用频谱特征提取与无监督机器学习,具体而言是Uniform Manifold Approximation (UMAP),从全天家庭录音中提取婴儿与照料者发声的一种新颖二维空间表示。UMAP产生一个连续且分布良好的空间,有助于婴儿发声发展的某些分析。例如,我们发现婴儿发声声学在二维空间内的离散度在一天中从3到9个月增加,随后从9到18个月减少。该方法也允许分析婴儿与成人发声间的相似性,其同样随婴儿年龄呈现变化。
引用
@article{arxiv.2204.12279,
title = {Low-dimensional representation of infant and adult vocalization acoustics},
author = {Silvia Pagliarini and Sara Schneider and Christopher T. Kello and Anne S. Warlaumont},
journal= {arXiv preprint arXiv:2204.12279},
year = {2022}
}
备注
Under review at Interspeech 2022