从三秒音频预测突发停顿事件:分层评估揭示严重性选择性前兆,模型可全程部署于设备端
摘要
目前的基于音频的停顿系统侧重于检测——即判断当前是否存在停顿——而预测能力(即为闭环干预所需的能力)在可部署规模上尚未得到研究。我们在SEP-28k(Apple,包含20,131个三秒片段)上训练一个616K参数的CNN,用于预测下一个连续片段是否包含任何停顿。(1)严重性选择性前兆信号:在按事件分组的测试集上,综合preblock AUC尚可(0.581 [0.542, 0.619]),但按即将发生的事件类型进行分层后发现,严重事件(blocks 0.601 [0.554, 0.651])和语音重复(sound repetitions 0.617 [0.567, 0.667])均显著高于随机,而填充词(fillers 0.45)和词重复(word repetitions 0.49)接近随机。由于严重事件携带副音前兆信号,而填充词则无此特征,aggregate objective因此趋向于严重性选择性预测器。(2)跨人群迁移:无需微调,同一检查点应用于1,024例儿童儿童停顿语音(FluencyBank Teaching)数据集,检测AUC达0.674,预测AUC达0.655;DisfluencySpeech和LibriStutter分别达到0.58-0.60 AUC。(3)设备端部署:无损导出至CoreML(1.19 MB)、ONNX(40 KB)、TFLite。Neural-Engine每3秒窗口延迟:0.25 ms(iPhone 17 Pro Max,A19 Pro)至0.55 ms(iPhone SE第3代和M1 Max)。4 Hz流式模拟使用0.54%的实时预算。Platt校准后的输出(测试ECE 0.010,原始为0.177)。五项负面消除实验——输出级未来导向学习、多片段GRU、时间轴拼接、非对称focal loss、直接块目标训练——均未超过基础基线。
引用
@article{arxiv.2604.27279,
title = {Predicting Upcoming Stuttering Events from Three-Second Audio: Stratified Evaluation Reveals Severity-Selective Precursors, and the Model Deploys Fully On-Device},
author = {Nazar Kozak},
journal= {arXiv preprint arXiv:2604.27279},
year = {2026}
}
备注
8 pages, 4 figures, 9 tables. Submitted to IEEE/ACM Transactions on Audio, Speech, and Language Processing