基于瓶颈Transformer的改进自动STOI分数预测方法
音频与语音处理
2026-03-11 v2 机器学习
信号处理
摘要
在本研究中,我们提出了一种新颖的方法,使用瓶颈Transformer架构来预测短时客观可懂度(STOI)指标。计算STOI的传统方法通常需要干净的参考语音,这限制了其在现实世界中的适用性。为了解决这个问题,许多基于深度学习的非侵入式语音评估模型引起了广泛关注。许多研究取得了值得称赞的性能,但仍有进一步改进的空间。我们提出使用瓶颈Transformer,结合卷积块来学习帧级特征,以及一个多头自注意力(MHSA)层来聚合信息。这些组件使Transformer能够专注于输入数据的关键方面。与使用自监督学习(SSL)和频谱特征作为输入的最先进模型相比,我们的模型在已见和未见场景下都显示出更高的相关性和更低的均方误差。
引用
@article{arxiv.2602.15484,
title = {Bottleneck Transformer-Based Approach for Improved Automatic STOI Score Prediction},
author = {Amartyaveer and Murali Kadambi and Chandra Mohan Sharma and Anupam Mondal and Prasanta Kumar Ghosh},
journal= {arXiv preprint arXiv:2602.15484},
year = {2026}
}
备注
7 pages, 7 tables, 2 figures, ASRU 2025