ZevoMOS 参加 VoiceMOS Challenge 2022 的方案
音频与语音处理
2022-06-16 v1
摘要
本文介绍 ZevoMOS 参加 VoiceMOS Challenge 2022 主赛道的方案。ZevoMOS 提交结果基于预训练自监督学习(SSL)语音模型的两步微调。第一步使用自然语音与合成语音分类任务,第二步任务为预测与各训练样本相关的 MOS 分数。微调过程的结果随后与从自动语音识别模型提取的置信度分数,以及从 wav2vec SSL 语音模型获得的训练样本原始嵌入相组合。ZevoMOS 系统在 VoiceMOS Challenge 中被分配团队编号为 T01。该提交在系统级 SRCC 上排名第 14,在语句级 MSE 上排名第 9。本文还给出了对中间结果的额外评估。
引用
@article{arxiv.2206.07448,
title = {The ZevoMOS entry to VoiceMOS Challenge 2022},
author = {Adriana Stan},
journal= {arXiv preprint arXiv:2206.07448},
year = {2022}
}
备注
Accepted at Interspeech 2022 - VoiceMOS Challenge; 5 pages, 2 figures, 2 tables