中文

使用带有人机回环评估指标的生成对抗网络进行无监督口罩语音增强

音频与语音处理 2024-07-23 v2 信号处理

摘要

佩戴口罩是一项基本的医疗保健措施,尤其是在大流行病期间,但它会给日常生活中的交流带来挑战。为了解决这个问题,我们提出了一种名为人机回环 StarGAN(HL-StarGAN)的口罩语音增强新方法。HL-StarGAN 包含判别器、分类器、指标评估预测器以及一个利用注意力机制的生成器。被称为 MaskQSS 的指标评估预测器在其开发过程中引入了人类参与者,并在 HL-StarGAN 的学习过程中充当“人机回环”模块。整个 HL-StarGAN 模型使用无监督学习策略进行训练,该策略同时关注原始纯净语音的重建和人类感知的优化。为了实现 HL-StarGAN,我们构建了一个名为“FMVD”的口罩语音数据库,该数据库包含 34 名说话者在三种不同佩戴口罩场景和一种纯净条件下的录音。我们使用该数据库对所提出的 HL-StarGAN 进行了主观和客观测试。测试结果如下:(1) MaskQSS 成功预测了口罩语音的质量评分,优于几种现有的语音评估方法。(2) MaskQSS 预测器的集成增强了 HL-StarGAN 将口罩语音转换为高质量语音的能力;这种增强在客观和主观测试中均表现明显,优于传统的 StarGAN 和基于 CycleGAN 的系统。

关键词

引用

@article{arxiv.2407.01939,
  title  = {Unsupervised Face-Masked Speech Enhancement Using Generative Adversarial Networks With Human-in-the-Loop Assessment Metrics},
  author = {Syu-Siang Wang and Jia-Yang Chen and Bo-Ren Bai and Shih-Hau Fang and Yu Tsao},
  journal= {arXiv preprint arXiv:2407.01939},
  year   = {2024}
}

备注

face-mask speech enhancement, generative adversarial networks, StarGAN, human-in-the-loop, unsupervised learning