优化自动语音评估:W-RankSim 正则化与混合特征融合策略
声音
2024-06-18 v1 人工智能
计算与语言
音频与语音处理
摘要
自动语音评估(ASA)近期在利用自监督特征(SSL)方面取得了显著进展。然而,ASA 的关键挑战在于数据分布的不平衡,尤其体现在英语测试数据集中。为解决这一问题,我们将 ASA 视为一个序数分类任务,引入加权向量排序相似性(W-RankSim)作为一种 novel 的正则化技术。W-RankSim 鼓励类似类别中加权向量在输出层中彼此更接近,意味着具有相似标签的特征向量将在逐渐趋近于对应加权向量的过程中逐渐被 nudged 彼此靠近。大量实验评估表明,我们的方法在改善 ASA 的序数分类性能方面效果显著。此外,我们提出了一种混合模型,将 SSL 与手工特征相结合,展示了包含手工特征在内的混合模型如何提升 ASA 系统的性能。
引用
@article{arxiv.2406.10873,
title = {Optimizing Automatic Speech Assessment: W-RankSim Regularization and Hybrid Feature Fusion Strategies},
author = {Chung-Wen Wu and Berlin Chen},
journal= {arXiv preprint arXiv:2406.10873},
year = {2024}
}
备注
Accepted to Interspeech 2024