用于多阶段语音增强的交替式 Approach-Putt 模型
声音
2025-08-15 v1 人工智能
机器学习
音频与语音处理
摘要
基于人工神经网络的语音增强旨在从含噪语音信号中去除噪声,同时保留语音内容。然而,语音增强网络常常会引入信号失真,即所谓的伪影,这会降低音频质量。在本工作中,我们提出了一种后处理神经网络,旨在减轻语音增强模型引入的伪影。受高尔夫球中先“Approach”后“Putt”的类比启发,我们将该模型命名为 PuttNet。我们证明,在语音增强模型与所提出的 Putt 模型之间交替进行,能够提升语音质量,这通过感知质量评分(PESQ)、客观可懂度(STOI)和背景噪声侵入性(CBAK)评分来衡量。此外,我们通过图形分析说明了为何这种交替式 Approach 方法优于单独重复应用任一模型。
引用
@article{arxiv.2508.10436,
title = {Alternating Approach-Putt Models for Multi-Stage Speech Enhancement},
author = {Iksoon Jeong and Kyung-Joong Kim and Kang-Hun Ahn},
journal= {arXiv preprint arXiv:2508.10436},
year = {2025}
}
备注
This work has been submitted to the IEEE for possible publication