基于分析驱动的引擎声音数据集生成,嵌入控制注释
声音
2026-03-10 v1 机器学习
音频与语音处理
摘要
计算引擎声音建模是汽车音频行业的核心,尤其对于主动声设计、虚拟原型设计以及新兴的数据驱动引擎声音合成方法至关重要。这些应用需要大量标准化、干净的音频录音,并附带精确的时间对齐的运行状态注释:由于高成本、专业测量设备要求以及不可避免的噪声污染,这类数据难以获取。我们提出一种基于分析驱动的框架,用于生成带有样本级控制注释的引擎音频。该方法通过升调自适应谱分析从真实录音中提取谐波结构,然后驱动扩展的参数化谐波加噪声合成器。通过该框架,我们生成了程序化引擎声音数据集(19小时,5935文件),包含样本级转速和扭矩注释,涵盖广泛的运行条件、信号复杂性和谐波特征。与真实录音的对比验证了合成数据保留了特征谐波结构,基准实验确认了其适用于基于学习的参数估计和合成任务。该数据集已公开发布,以支持引擎声韵分析、控制参数估计、声学建模和神经生成网络研究。
引用
@article{arxiv.2603.07584,
title = {Analysis-Driven Procedural Generation of an Engine Sound Dataset with Embedded Control Annotations},
author = {Robin Doerfler and Lonce Wyse},
journal= {arXiv preprint arXiv:2603.07584},
year = {2026}
}
备注
Preprint. 19 hours of engine audio, 5,935 files, sample-accurate annotations. Dataset publicly available at https://doi.org/10.5281/zenodo.16883336 and https://huggingface.co/datasets/rdoerfler/procedural-engine-sounds