大型音频语言模型能否理解儿童 stuttering speech?语音总结与源分离
音频与语音处理
2025-10-27 v1 计算与语言
声音
摘要
儿童语音在语音学、韵律和语言发展方面不同于成人语音,以及附加的语病(重复、延长、阻塞),这些都给自动语音识别(ASR)和下游自然语言处理(NLP)带来了挑战。最近的大型音频语言模型(LALMs)在跨模态音频理解方面表现出强大的能力;然而,它们在不规则儿童语音中的行为仍未得到充分探索。我们评估了多种最先进的LALMs在两个情境下:访谈(混合说话者)和朗读任务(单孩童)。任务包括(i)单通道源分离以隔离儿童语音,以及(ii)仅保留儿童语音的总结,该总结保留临床相关的语病并避免成人语音泄漏。评估结合了大型语言模型(LLM)作为裁判、人类专家评分和BERTScore(F1),并报告模型之间以及模型与人类之间的一致性,以评估可靠性。我们的发现描绘了LALMs在混合音频中产生可靠儿童语音总结的条件,以及它们的局限性,为临床和教育部署提供了实用指导。我们提供提示和评估脚本以支持复制。
关键词
引用
@article{arxiv.2510.20850,
title = {Can large audio language models understand child stuttering speech? speech summarization, and source separation},
author = {Chibuzor Okocha and Maya Bakri and Christan Grant},
journal= {arXiv preprint arXiv:2510.20850},
year = {2025}
}
备注
7 pages, 1 Figure, 8 tables, Under review ICASSP 2026