中文

cak: emergent audio effects from minimal deep learning

机器学习 2025-08-05 v1 声音 音频与语音处理

摘要

我们展示了单一的3x3卷积核在训练来自个人语料库的200个样本后可产生涌现音频效果。我们通过两种关键技术实现了这一点:(1)条件感知核(CAK),其中output = input + (learned_pattern x control),采用软门控机制支持在control为零时实现身份保留;(2)AuGAN(Audit GAN),将对抗训练从"这是否为真?"重新框定为"你是否应用了请求的值?"。相较于学习生成或检测伪造物,our networks合作以验证control应用,发现独特的转换。所学卷积核表现出对角线结构,创建频率依赖的时序位移,能够根据输入特征产生音乐效果。我们的结果表明,对抗训练可从最小数据中发现音频转换,为新的效果设计方法提供了潜力。

关键词

引用

@article{arxiv.2508.02643,
  title  = {CAK: Emergent Audio Effects from Minimal Deep Learning},
  author = {Austin Rockman},
  journal= {arXiv preprint arXiv:2508.02643},
  year   = {2025}
}

备注

8 pages, 3 figures, code and other resources at https://github.com/gloame-ai/cak-audio/tree/main/cak-audio