探索大型多模态模型作为发音评估有效替代方案的潜力
声音
2025-03-17 v1 计算与语言
音频与语音处理
摘要
大型多模态模型在广泛的领域展现出了卓越的性能。本文探讨了它们在发音评估任务中的潜力,特别关注评估生成式预训练 Transformer(Generative Pre-trained Transformer, GPT)模型的能力,具体为 GPT-4o。我们的研究调查了其在多个粒度和维度上处理语音和音频以进行发音评估的能力,重点是反馈生成和评分。在我们的实验中,我们使用了公开可用的 Speechocean762 数据集。评估侧重于两个关键方面:多级评分和生成反馈的实用性。评分结果与 Speechocean762 数据集中提供的人工评分进行比较,而反馈质量则使用大语言模型进行评估。研究结果突出了将大型多模态模型与传统方法相结合在发音评估中的有效性,提供了关于模型优势的见解并指出了进一步改进的方向。
引用
@article{arxiv.2503.11229,
title = {Exploring the Potential of Large Multimodal Models as Effective Alternatives for Pronunciation Assessment},
author = {Ke Wang and Lei He and Kun Liu and Yan Deng and Wenning Wei and Sheng Zhao},
journal= {arXiv preprint arXiv:2503.11229},
year = {2025}
}
备注
7 pages