Text2FX: 利用 CLAP 嵌入实现文本引导的音频效果
音频与语音处理
2025-02-21 v2 声音
摘要
本工作介绍了 Text2FX,这是一种利用 CLAP 嵌入与可微数字信号处理,通过开放词汇表的自然语言提示(例如“使该声音直白且大胆”)来控制音频效果(如均衡与混响)的方法。Text2FX 无需重新训练任何模型,而是依赖于现有嵌入空间内的单实例优化,从而通过可解释且解耦的 FX 操控,实现了一种灵活、可扩展的开放词汇表声音变换方法。我们表明 CLAP 编码了用于控制音频效果的宝贵信息,并提出了两种使用 CLAP 将文本映射至音频效果参数的优化方法。虽然我们以 CLAP 进行演示,但该方法适用于任何共享的文本-音频嵌入空间。类似地,虽然我们以均衡与混响进行演示,但任何可微音频效果均可被控制。我们使用多样的文本提示与源音频开展了听者研究,以评估这些方法的质量及其与人类感知的对齐度。演示与代码可在 anniejchu.github.io/text2fx 获取。
引用
@article{arxiv.2409.18847,
title = {Text2FX: Harnessing CLAP Embeddings for Text-Guided Audio Effects},
author = {Annie Chu and Patrick O'Reilly and Julia Barnett and Bryan Pardo},
journal= {arXiv preprint arXiv:2409.18847},
year = {2025}
}
备注
Accepted to ICASSP 2025. Source code and audio examples: https://anniejchu.github.io/text2fx/