一种基于统计的可微分方法用于声音纹理合成与分析
声音
2025-06-05 v1 音频与语音处理
摘要
在本工作中,我们引入了 TexStat,一种专门设计用于分析和合成具有随机结构和感知平稳性的纹理声音的新型损失函数。借鉴 McDermott 和 Simoncelli 的统计与感知框架,TexStat 在不依赖时间结构的情况下识别属于同一纹理类别的信号之间的相似性。我们还提出将 TexStat 与 Fréchet 音频距离(FAD)一同用作验证指标,以评估纹理声音合成模型。此外,我们提出了 TexEnv,一个高效、轻量且可微分的纹理声音合成器,通过对滤波噪声施加幅度包络来生成音频。我们进一步将这些组件集成到 TexDSP 中,这是一个面向纹理声音的、受到 DDSP 启发的生成模型。通过在各种纹理声音类型上的广泛实验,我们证明了 TexStat 具有感知意义、时间不变性和对噪声的鲁棒性,这些特性使其既可作为生成任务的损失函数,也可作为感知驱动的评估指标。所有工具和代码均以开源贡献形式提供,我们的 PyTorch 实现高效、可微分且高度可配置,使其适用于生成任务和作为感知基础的评估指标。
引用
@article{arxiv.2506.04073,
title = {A Statistics-Driven Differentiable Approach for Sound Texture Synthesis and Analysis},
author = {Esteban Gutiérrez and Frederic Font and Xavier Serra and Lonce Wyse},
journal= {arXiv preprint arXiv:2506.04073},
year = {2025}
}
备注
Accepted to the 28th International Conference on Digital Audio Effects (DAFx 2025) to be held in Ancona, Italy. 8 pages, one diagram and 5 tables