基于块的多SSL融合用于自动流畅度评估
计算与语言
2025-06-27 v1 人工智能
音频与语音处理
摘要
自动流畅度评估(AFA)仍具有挑战性,尤其是在捕获非母语者的语音节奏、停顿和不连贯现象方面。我们提出一种基于块的方法,将自监督学习(SSL)模型(Wav2Vec2、HuBERT 和 WavLM)与层次化 CNN-BiLSTM 框架集成。该方法选取这三种SSL模型是因为它们在语音特征建模方面具有互补优势:Wav2Vec2 擅长语音信号的底层特征提取,HuBERT 在韵律特征捕获方面表现突出,WavLM 在噪声环境下的鲁棒性更佳。语音被分割为呼吸组块(breath-group chunks),采用 Silero-VAD 进行语音活动检测,实现细粒度的时间分析,同时缓解过度分割的副作用。SSL 嵌入通过可学习的加权机制进行融合,平衡声学与语言特征,并增强块级流畅度标记(如语速、停顿时长、n-gram 重复等)。CNN-BiLSTM 捕获块之间的最近邻依赖和长程依赖。实验在 Avalinguo 和 Speechocean762 数据集上进行,相较于单一SSL基线,在 Speechocean762 上F1分数提升2.8分,Pearson相关系数提升6.2分;在 Avalinguo 数据集上,F1分数提升4.2分,Pearson相关系数提升4.0分,超越了基于 Pyannote.audio 的分段基线。这些结果表明,块化多SSL融合方法对于鲁棒的流畅度评估具有显著优势,尽管未来工作应探索针对语调不规则的方言进行的泛化能力。
引用
@article{arxiv.2506.20243,
title = {CBF-AFA: Chunk-Based Multi-SSL Fusion for Automatic Fluency Assessment},
author = {Papa Séga Wade and Mihai Andries and Ioannis Kanellos and Thierry Moudenc},
journal= {arXiv preprint arXiv:2506.20243},
year = {2025}
}
备注
5 pages, accepted for presentation at EUSIPCO 2025