中文

多通道 MOSRA:基于模拟数据与教师模型的均值意见分数与房间声学估计

音频与语音处理 2024-03-14 v2 声音

摘要

以往预测房间声学参数和语音质量指标的方法聚焦于单通道情形,即针对单一录音设备预测房间声学和均值意见分数(MOS)。然而,对于具有多个录音设备的房间,基于质量的选择可能受益于多通道方法,即并行预测多个设备的描述性指标。遵循模型可从多通道训练中获益的假设,我们开发了多通道模型,用于并行对五个通道进行联合 MOS 与房间声学预测(MOSRA)。缺乏带真实标签的多通道音频数据,需要使用声学模拟器创建模拟数据,其中房间声学标签从生成的脉冲响应中提取,MOS 标签则通过基于 wav2vec2 的 MOS 预测模型以师生框架生成。我们的实验表明,多通道模型在直接混响比、清晰度和语音传输指数预测上优于单通道模型,计算量约为其 1/5(即少约 5×\times),而其他指标性能损失极小。

关键词

引用

@article{arxiv.2309.11976,
  title  = {Multi-Channel MOSRA: Mean Opinion Score and Room Acoustics Estimation Using Simulated Data and a Teacher Model},
  author = {Jozef Coldenhoff and Andrew Harper and Paul Kendrick and Tijana Stojkovic and Milos Cernak},
  journal= {arXiv preprint arXiv:2309.11976},
  year   = {2024}
}

备注

Accepted at ICASSP 2024