一种用于多模态助听器中基于云的音视频语音增强的新型帧结构
音频与语音处理
2022-10-25 v1 声音
信号处理
摘要
在本文中,我们设计了一种首创的用于基于云的音视频(AV)语音增强(SE)的收发器(PHY 层)原型,符合未来多模态助听辅助技术的高数据速率和低延迟要求。该创新设计需要满足多个具有挑战性的约束,包括上/下行链路通信、传输与信号处理延迟以及实时 AV SE 模型处理。该收发器具备设备检测、帧检测、频偏估计和信道估计能力。我们基于数据速率和延迟要求开发了上行链路(助听器到云)和下行链路(云到助听器)帧结构。由于上行链路信息(音频和唇读)具有变化特性,上行链路信道支持多数据速率帧结构,而下行链路信道具有固定数据速率帧结构。此外,我们使用 LabVIEW NXG 评估了所开发帧结构的收发器不同 PHY 层模块的延迟。这可与软件定义无线电(如 Universal Software Radio Peripheral)一起用于实时演示场景。
引用
@article{arxiv.2210.13127,
title = {A Novel Frame Structure for Cloud-Based Audio-Visual Speech Enhancement in Multimodal Hearing-aids},
author = {Abhijeet Bishnu and Ankit Gupta and Mandar Gogate and Kia Dashtipour and Ahsan Adeel and Amir Hussain and Mathini Sellathurai and Tharmalingam Ratnarajah},
journal= {arXiv preprint arXiv:2210.13127},
year = {2022}
}