面向语音呼吸模式的预训练基础模型表示
声音
2024-07-19 v1 计算与语言
机器学习
音频与语音处理
摘要
人类语音生产过程涉及 coordinated 的呼吸动作以产生声学语音信号。通常情况下,语音是在从肺部逐气而出时产生的,气流被声门调制,其中此类动作被呼吸气吸入肺部的瞬间中穿插。呼吸率(RR)是用于评估个体整体健康、体能和一般健康的关键指标。现有的RR测量方法(每分钟呼吸次数)需要专业设备或训练。研究表明,机器学习算法可用于使用生物传感器信号输入来估计RR。基于语音的RR估计可为测量该关键指标提供一种无需专业设备或传感器的方法。本工作研究了一种基于机器学习的方法,从说话者对近程话筌的语音片段中估计RR。数据来自N=26名个体,通过商业级胸带获取基准RR,然后手动校正任何错误。提出了一种卷积长短期记忆网络(Conv-LSTM)用于从语音信号中估计呼吸时间序列数据。我们展示,使用来自基础模型(如Wav2Vec2)的预训练表示可用于估计呼吸时间序列数据,平均绝对误差(MAE)约为1.6次/分。
引用
@article{arxiv.2407.13035,
title = {Pre-Trained Foundation Model representations to uncover Breathing patterns in Speech},
author = {Vikramjit Mitra and Anirban Chatterjee and Ke Zhai and Helen Weng and Ayuko Hill and Nicole Hay and Christopher Webb and Jamie Cheng and Erdrin Azemi},
journal= {arXiv preprint arXiv:2407.13035},
year = {2024}
}
备注
8 pages, 6 figures, BioKDD workshop paper