中文

基于示例的类比音频纹理操作

声音 2025-01-22 v1 机器学习 音频与语音处理

摘要

音频纹理操作涉及修改声音的感知特征,以实现特定转换,如添加、删除或替换听觉元素。本文提出一种基于示例的类比模型,用于音频纹理操作。我们的 метод不依赖文本化指令,而是使用配对语音示例,其中一个片段代表原始声音,另一个示例所需的转换。模型学习对新输入应用相同的转换,从而实现声音纹理的操控。我们构建了一个代表 various 编辑任务的四元组数据集,并以自监督方式训练潜在扩散模型。通过定量评估和感知研究,我们表明该方法优于文本条件化基线,并能在真实世界、离分布和非语音场景中泛化。项目页面:https://berkeley-speech-group.github.io/audio-texture-analogy/

关键词

引用

@article{arxiv.2501.12385,
  title  = {Audio Texture Manipulation by Exemplar-Based Analogy},
  author = {Kan Jen Cheng and Tingle Li and Gopala Anumanchipalli},
  journal= {arXiv preprint arXiv:2501.12385},
  year   = {2025}
}

备注

ICASSP 2025