K-Function:儿童语言功能的联合发音转录与反馈评估框架
计算与语言
2026-02-25 v3 人工智能
声音
音频与语音处理
摘要
由于高音、延长音以及数据有限的特点,自动语音识别器在评估幼儿语言时颇具挑战。我们引入 K-Function,一个结合精准亚词转录与由大语言模型驱动的客观评分的框架。其核心是 Kids-Weighted Finite State Transducer(K-WFST),它融合声学音素编码器与音素相似度模型,以捕捉儿童特定语音错误,同时保持完全可解释性。K-WFST 在 MyST 和 Multitudes 上的音素错误率分别为 1.39% 和 8.61%,相较于贪婪搜索解码器分别提升了 10.47% 和 7.06%。这些高质量的转录文本被用于 LLM 对语言技能、发展里程碑、阅读和理解进行评分,结果与人类评估者的评估高度一致。我们的发现表明,精准的音素识别对于创建有效的评估框架至关重要,使我们能够为儿童实现可扩展的语言筛查。
引用
@article{arxiv.2507.03043,
title = {K-Function: Joint Pronunciation Transcription and Feedback for Evaluating Kids Language Function},
author = {Shuhe Li and Chenxu Guo and Jiachen Lian and Cheol Jun Cho and Wenshuo Zhao and Xiner Xu and Ruiyu Jin and Xiaoyu Shi and Xuanru Zhou and Dingkun Zhou and Sam Wang and Grace Wang and Jingze Yang and Jingyi Xu and Ruohan Bao and Xingrui Chen and Elise Brenner and Brandon In and Francesca Pei and Maria Luisa Gorno-Tempini and Gopala Anumanchipalli},
journal= {arXiv preprint arXiv:2507.03043},
year = {2026}
}
备注
Accepted to 2026 ICASSP