中文

LSTMSE-Net:用于音视频语音增强的长短期记忆语音增强网络

声音 2025-02-12 v1 机器学习 多媒体 音频与语音处理

摘要

本文提出了长短期记忆语音增强网络 (LSTMSE-Net),这是一种音视频语音增强 (AVSE) 方法。该创新方法利用视觉与音频信息的互补性来提升语音信号质量。使用 VisualFeatNet (VFN) 提取视觉特征,音频特征通过编码器和解码器进行处理。系统对视觉和音频特征进行比例缩放和拼接,然后通过分离网络进行处理,以实现优化的语音增强。该体系结构突出了在多模态数据和插值技术方面的进步,为稳健的 AVSE 挑战系统提供了解决方案。LSTMSE-Net 的性能在尺度不变信噪比 (SISDR) 上提高了 0.06,在短时目标可懂性 (STOI) 上提高了 0.03,在感知语音质量评估 (PESQ) 上提高了 1.32。 proposed LSTMSE-Net 的源代码已公开于 \url{https://github.com/mtanveer1/AVSEC-3-Challenge}。

关键词

引用

@article{arxiv.2409.02266,
  title  = {LSTMSE-Net: Long Short Term Speech Enhancement Network for Audio-visual Speech Enhancement},
  author = {Arnav Jain and Jasmer Singh Sanjotra and Harshvardhan Choudhary and Krish Agrawal and Rupal Shah and Rohan Jha and M. Sajid and Amir Hussain and M. Tanveer},
  journal= {arXiv preprint arXiv:2409.02266},
  year   = {2025}
}