中文

面向自动发音评估的大型多模态模型微调

计算与语言 2025-09-22 v1 声音 音频与语音处理

摘要

自动发音评估(APA)对计算机辅助语言学习(CALL)至关重要,需要在多种粒度和方面进行评估。大型多模态模型(LMM)为 APA 带来了新机遇,但其在细粒度评估中的有效性仍不确定。本研究使用 Speechocean762 数据集和一个私有语料库,探讨了针对 APA 的 LMM 微调。微调显著优于零样本设置,并在单粒度任务上与公开和商业系统相比取得了具有竞争力的结果。该模型在词级和句级表现良好,而音素级评估仍具挑战性。我们还观察到,皮尔逊相关系数(PCC)达到 0.9,而斯皮尔曼等级相关系数(SCC)保持在 0.6 左右,这表明 SCC 能更好地反映顺序一致性。这些发现突显了 LMM 在 APA 中的潜力与局限性,并为未来在细粒度建模和排序感知评估方面的工作指明了方向。

关键词

引用

@article{arxiv.2509.15701,
  title  = {Fine-Tuning Large Multimodal Models for Automatic Pronunciation Assessment},
  author = {Ke Wang and Wenning Wei and Yan Deng and Lei He and Sheng Zhao},
  journal= {arXiv preprint arXiv:2509.15701},
  year   = {2025}
}

备注

submitted to ICASSP2026