噪声环境下基于语音相关的数据增强用于可听设备麦克风的自声重建
音频与语音处理
2025-08-20 v1
摘要
在噪声环境中,可听设备的自声拾取受益于同时使用耳道外和耳道内的外部和内部麦克风。由于两个麦克风记录的环境噪声,以及低频自声的放大和内部麦克风的带宽限制,需要自声重建系统来实现通信。训练基于监督深度学习的自声重建系统需要大量自声信号。训练数据可以通过使用特定设备记录大量不同说话者的自声信号(成本高昂)或通过增强现有语音数据来获得。自声信号可以通过假设每个音素的可听设备麦克风之间的线性时不变相对传递函数(称为自声传递特性)来模拟。在本文中,我们提出了基于可听设备麦克风之间自声传递特性的语音相关模型的数据增强技术,用于训练自声重建系统。所提出的技术使用少量记录的自声信号来估计传递特性,然后可以基于单通道语音信号模拟大量自声信号。实验结果表明,与其他数据增强技术或仅使用可用记录的自声信号进行训练相比,所提出的语音相关个体数据增强技术带来了更好的性能,并且对可用记录信号进行额外微调可以进一步提高性能。
引用
@article{arxiv.2405.11592,
title = {Speech-dependent Data Augmentation for Own Voice Reconstruction with Hearable Microphones in Noisy Environments},
author = {Mattes Ohlenbusch and Christian Rollwage and Simon Doclo},
journal= {arXiv preprint arXiv:2405.11592},
year = {2025}
}
备注
19 pages, 6 figures