中文

基于不确定性引导的 StutterCut 正规化割分段法用于顿语摘录

声音 2025-08-05 v1 人工智能 音频与语音处理

摘要

检测和分割顿语对于有效的语音治疗和实时反馈至关重要。然而,大多数方法仅在语篇层面对顿语进行分类。我们引入StutterCut,一个半监督框架,将顿语分割建模为图划分问题,其中来自重叠窗口的语音嵌入表示为图节点。我们利用在弱标记(语篇级)标签上训练的伪oracle分类器来细化节点之间的连接,其影响通过蒙特卡罗 dropout 的不确定性测量加以控制。此外,我们扩展了弱标记的 FluencyBank 数据集,纳入四种顿语类型的帧级顿语边界。这提供了一个更贴近现实的基准,与合成数据集不同。在真实和合成数据集上的实验表明,StutterCut 超过了现有方法,实现了更高的 F1 分数和更精确的顿语起始检测。

关键词

引用

@article{arxiv.2508.02255,
  title  = {StutterCut: Uncertainty-Guided Normalised Cut for Dysfluency Segmentation},
  author = {Suhita Ghosh and Melanie Jouaiti and Jan-Ole Perschewski and Sebastian Stober},
  journal= {arXiv preprint arXiv:2508.02255},
  year   = {2025}
}

备注

Accepted in Interspeech 2025