中文

音视频语音增强:架构设计与部署策略

声音 2026-04-29 v5 信号处理

摘要

实时音视频语音增强(AVSE)是沉浸式交互多媒体服务的关键使能技术,但其性能受到网络延迟、上行链路容量和计算延迟的严格限制。本文介绍了一个在公共 5G 边缘网络上运行的完整云边协同 AVSE 系统的设计、部署和评估。该系统集成了基于 CNN 的声学增强和基于 OpenCV 的面部特征提取,并通过 LSTM 融合网络保持时间一致性,部署在兼容 Vodafone 的 AWS Wavelength 边缘云上。通过广泛的压力测试,我们分析了在不同网络负载和自适应多媒体配置下的端到端性能。结果表明,将计算放置在网络边缘对于满足实时一致性约束至关重要,并且上行链路容量通常是交互式 AVSE 服务的主要瓶颈。只有 5G 和有线以太网能够持续满足未压缩音视频块所需的通信延迟界限,而激进压缩可将有效载荷大小减少多达 80%,且感知质量下降可忽略不计,从而在受限条件下实现鲁棒运行。我们进一步揭示了处理延迟与增强质量之间的基本权衡,即降低模型复杂度会减少延迟,但在低信噪比场景下会降低重建性能。我们的发现表明,当网络和计算资源被精心编排时,公共 5G 边缘环境可以维持实时、交互式的 AVSE 工作负载,尽管性能裕度比专用基础设施更紧张。从本研究中得出的架构见解,为在新兴的 5G 边缘云平台上设计延迟敏感的多媒体和感知增强服务提供了实用指南。

关键词

引用

@article{arxiv.2508.08468,
  title  = {Audio-Visual Speech Enhancement: Architectural Design and Deployment Strategies},
  author = {Anis Hamadouche and Haifeng Luo and Mathini Sellathurai and Amir Hussain and Tharm Ratnarajah},
  journal= {arXiv preprint arXiv:2508.08468},
  year   = {2026}
}

备注

There was mistake in the model baseline