中文

通过生成式脉冲响应数据增强提升说话人距离估计

声音 2026-05-04 v1 人工智能 音频与语音处理 信号处理

摘要

ICASSP 2025 上的房间声学与说话人距离估计(SDE)挑战探讨了稀疏房间脉冲响应(RIR)数据对提高 SDE 模型性能的有效性。该挑战在 GenDARA 中进行,涉及生成 RIR 以补充数据集并使用增强数据微调 SDE 模型。我们采用仅依赖于说话人和听众位置的开源快速漫射型房间脉冲响应生成器(FastRIR)生成 RIR。我们设计了质量过滤器以确保生成的 RIR 与挑战 RIR 一致,并进行超参数优化以进行模型微调。我们的方法将五个位置的平均绝对误差(MAE)从 1.66m 降至 0.6m(GWA 房间),从 2.18m 降至 0.69m(Treble 房间),结果表明数据增强方法显著提高了估计精度,尤其是在中远距离。

关键词

引用

@article{arxiv.2605.00721,
  title  = {Towards Improving Speaker Distance Estimation through Generative Impulse Response Augmentation},
  author = {Anton Ratnarajah and Mehmet Ergezer and Arun Nair and Mrudula Athi},
  journal= {arXiv preprint arXiv:2605.00721},
  year   = {2026}
}

备注

Accepted to Generative Data Augmentation for Real-World Signal Processing Applications (GenDA 2025). An ICASSP 2025 Satellite Workshop and IEEE Data Science and Learning Workshop: Room Acoustics and Speaker Distance Estimation Challenge