基于大语言模型的零样图非侵入式语音评估研究
音频与语音处理
2025-01-22 v2 声音
摘要
本工作探讨了两种利用大语言模型进行零样图非侵入式语音评估的策略。首先,我们探索了GPT-4o的音频分析能力。其次,我们提出了GPT-Whisper,该方法使用Whisper作为音频到文本模块,通过针对性的提示工程来评估文本的自然度。我们评估了GPT-4o和GPT-Whisper预测的评估指标,检验其与基于人类的质量和可理解性评估以及自动语音识别的字符错误率(CER)的相关性。实验结果表明,GPT-4o单独用于音频分析效果较差,而GPT-Whisper在预测准确性方面表现更好,对语音质量和可理解性具有适中的相关性,对CER的相关性更高。与SpeechLMScore和DNSMOS相比,GPT-Whisper在可理解性指标方面表现突出,但在质量估计方面略逊于SpeechLMScore。此外,GPT-Whisper在Spearman's rank correlation中优于监督的非侵入式模型MOS-SSL和MTI-Net。这些发现验证了GPT-Whisper在无需额外训练数据的情况下进行零样图语音评估的潜力。
引用
@article{arxiv.2409.09914,
title = {A Study on Zero-shot Non-intrusive Speech Assessment using Large Language Models},
author = {Ryandhimas E. Zezario and Sabato M. Siniscalchi and Hsin-Min Wang and Yu Tsao},
journal= {arXiv preprint arXiv:2409.09914},
year = {2025}
}
备注
Accepted to IEEE ICASSP 2025