利用并行评分数据与反对称孪生神经网络预测 TTS 音频刺激间的成对偏好
声音
2022-09-23 v1 计算与语言
音频与语音处理
摘要
自动预测主观听力测试的结果是一项具有挑战性的任务。即使听者间偏好一致,不同人的评分也可能存在差异。先前工作集中于预测听者对单个刺激的评分(平均意见分),而我们关注更简单的任务:给定同一文本的两条语音刺激,预测主观偏好。我们提出了一种基于反对称孪生神经网络的模型,以波形对及其对应偏好分数进行训练。我们探索了注意力与循环神经网络,以应对一对刺激间时间未对齐的问题。为获取大规模训练集,我们将 MUSHRA 测试中的听者评分转换为反映一对刺激中某一刺激被评高于另一刺激频率的数值。具体而言,我们在十二年(注:原文为五年)内进行的十二项 MUSHRA 评估数据上评估性能,这些数据包含由不同说话人数据构建的不同 TTS 系统。我们的结果优于训练用于预测 MOS 分数的最先进模型。
引用
@article{arxiv.2209.11003,
title = {Predicting pairwise preferences between TTS audio stimuli using parallel ratings data and anti-symmetric twin neural networks},
author = {Cassia Valentini-Botinhao and Manuel Sam Ribeiro and Oliver Watts and Korin Richmond and Gustav Eje Henter},
journal= {arXiv preprint arXiv:2209.11003},
year = {2022}
}