中文

运动后语音中的呼吸与语义停顿检测与疲劳程度分类

音频与语音处理 2025-09-22 v1 计算与语言 机器学习 声音

摘要

运动后语音包含丰富的生理和语言线索,常以语义停顿、呼吸停顿和组合呼吸-语义停顿形式出现。检测这些事件可用于评估恢复速率、肺功能以及疲劳相关异常。然而,现有工作在识别和区分此语境下不同类型的停顿方面有限。本文基于最近公开的同步音频和呼吸信号数据集,提供了系统的停顿类型注释。利用这些注释,我们系统地在深度学习模型(GRU、1D CNN-LSTM、AlexNet、VGG16)、声学特征(MFCC、MFB)以及层次化Wav2Vec2表示上,系统地进行呼吸和语义停顿检测与疲劳程度分类。我们评估了三种设置——单一特征、特征融合和两阶段检测-分类级联——在分类和回归两种 formulation 下。结果显示,语义停顿检测准确率最高可达89%,呼吸停顿为55%,组合停顿为86%,总体为73%,而疲劳程度分类达到90.5%的准确率,优于先前工作。

关键词

引用

@article{arxiv.2509.15473,
  title  = {Breathing and Semantic Pause Detection and Exertion-Level Classification in Post-Exercise Speech},
  author = {Yuyu Wang and Wuyue Xia and Huaxiu Yao and Jingping Nie},
  journal= {arXiv preprint arXiv:2509.15473},
  year   = {2025}
}

备注

6 pages, 3rd ACM International Workshop on Intelligent Acoustic Systems and Applications (IASA 25)