基于 Wav2vec 2.0 特征词袋法对家庭-婴儿发声复杂序列的可视化
音频与语音处理
2022-03-30 v1 计算与语言
声音
摘要
在美国,估计有约 15-17% 的 2-8 岁儿童至少患有一种确诊的精神、行为或发育障碍。然而,此类障碍常未被诊断,且在生命最初几年评估和诊治障碍的能力有限。为分析婴儿发育变化,既往研究表明先进的机器学习模型擅长分类使用手机、视频或仅音频记录设备(如 LENA)收集的婴儿和/或父母发声。本研究中,我们对所开发的新型婴儿可穿戴多模态设备 LittleBeats(LB)的音频组件进行试点测试。LB 音频流水线是先进的,相较于仅记录音频和/或提供说话人日记化标签的其他平台,它为说话人日记化与发声分类任务均提供可靠标签。我们利用 wav2vec 2.0 在 LB 家庭音频流上获得更优且更精细的结果。我们使用带有 wav2vec 2.0 特征的词袋(bag-of-audio-words)方法创建高层可视化,以理解家庭-婴儿发声交互。我们证明,我们的高质量可视化捕获了家庭发声交互的主要类型,这些类别指示了标记与未标记 LB 音频中的精神、行为和发育健康。
引用
@article{arxiv.2203.15183,
title = {Visualizations of Complex Sequences of Family-Infant Vocalizations Using Bag-of-Audio-Words Approach Based on Wav2vec 2.0 Features},
author = {Jialu Li and Mark Hasegawa-Johnson and Nancy L. McElwain},
journal= {arXiv preprint arXiv:2203.15183},
year = {2022}
}
备注
Submitted to Interspeech 2022