基于采样频率无关层的多采样频率自然度 MOS 预测自监督学习模型
声音
2025-08-20 v2 音频与语音处理
摘要
我们介绍了提交给 AudioMOS 挑战赛(AMC)2025 Track 3 的作品,用于语音多采样频率(SFs)的 mean opinion score(MOS)预测。我们的模型将一种 SF 无关(SFI)卷积层集成到自监督学习(SSL)模型中,以实现 SFI 语音特征提取,以进行 MOS 预测。我们提出了一些策略来提高模型的 MOS 预测性能:从预训练非 SFI-SSL 模型中蒸馏知识,并使用大规模 MOS 数据集进行预训练。我们提交给 AMC 2025 Track 3 的作品在一种评估指标上排名第一,在最终排名中排名第四。我们还报告了我们的消融研究结果,以探讨该模型的关键因素。
引用
@article{arxiv.2507.14647,
title = {Multi-Sampling-Frequency Naturalness MOS Prediction Using Self-Supervised Learning Model with Sampling-Frequency-Independent Layer},
author = {Go Nishikawa and Wataru Nakata and Yuki Saito and Kanami Imamura and Hiroshi Saruwatari and Tomohiko Nakamura},
journal= {arXiv preprint arXiv:2507.14647},
year = {2025}
}
备注
4 pages, 2 figures; Accepted to ASRU 2025 Challenge track