面向自动发音评估的大型多模态模型微调
计算与语言
2025-09-22 v1 声音
音频与语音处理
摘要
自动发音评估(APA)对计算机辅助语言学习(CALL)至关重要,需要在多种粒度和方面进行评估。大型多模态模型(LMM)为 APA 带来了新机遇,但其在细粒度评估中的有效性仍不确定。本研究使用 Speechocean762 数据集和一个私有语料库,探讨了针对 APA 的 LMM 微调。微调显著优于零样本设置,并在单粒度任务上与公开和商业系统相比取得了具有竞争力的结果。该模型在词级和句级表现良好,而音素级评估仍具挑战性。我们还观察到,皮尔逊相关系数(PCC)达到 0.9,而斯皮尔曼等级相关系数(SCC)保持在 0.6 左右,这表明 SCC 能更好地反映顺序一致性。这些发现突显了 LMM 在 APA 中的潜力与局限性,并为未来在细粒度建模和排序感知评估方面的工作指明了方向。
引用
@article{arxiv.2509.15701,
title = {Fine-Tuning Large Multimodal Models for Automatic Pronunciation Assessment},
author = {Ke Wang and Wenning Wei and Yan Deng and Lei He and Sheng Zhao},
journal= {arXiv preprint arXiv:2509.15701},
year = {2025}
}
备注
submitted to ICASSP2026