中文

学习感知相关的时域包络形变

声音 2025-11-25 v4 音频与语音处理 信号处理

摘要

时域包络形变,即在两个音频信号的幅度动态之间进行插值的过程,是生成式音频系统中的一个新兴问题,但缺乏充分的感知基础。以感知直观的方式对时域包络进行形变,应能为创意媒体中的声音混合和心理声学中探测感知组织提供新方法。然而,现有的音频形变技术在输入声音具有不同时域结构时,往往无法产生中间的时域包络;许多形变方法实际上只是将两种时域结构叠加,导致感知上不自然的结果。在本文中,我们引入了一种在感知指导下学习包络形变的新工作流:我们首先通过人类听觉研究推导出具有感知基础的形变原则,然后合成编码这些原则的大规模数据集,最后训练机器学习模型以创建感知上居中的形变。具体而言,我们提出:(1)指导包络形变的感知原则,这些原则源自我们的听觉研究;(2)学习这些原则的监督框架;(3)学习将时域包络结构压缩为潜在表示的自编码器;(4)使用合成和自然数据评估音频包络形变的基准,并表明我们的方法在产生时域居中的形变方面优于现有方法。所有代码、模型和检查点可在 https://github.com/TemporalMorphing/EnvelopeMorphing 获取。

关键词

引用

@article{arxiv.2506.01588,
  title  = {Learning Perceptually Relevant Temporal Envelope Morphing},
  author = {Satvik Dixit and Sungjoon Park and Chris Donahue and Laurie M. Heller},
  journal= {arXiv preprint arXiv:2506.01588},
  year   = {2025}
}

备注

Accepted at WASPAA 2025