SnakeSynth:生成式音频合成的新交互方式
人机交互
2023-07-13 v1 声音
音频与语音处理
摘要
我提出“SnakeSynth”,一种基于网络的轻量级音频合成器,它结合深度生成模型生成的音频与实时连续二维(2D)输入,通过2D交互手势创建并控制可变长度生成式声音。交互手势支持触摸与移动端,类比于拨奏、拉奏与弹拨乐器控制。点选与拖放手势直接控制音频播放长度,并且我展示了声音长度与强度由与可编程2D坐标网格的交互调制。借助Google的TensorFlow.js中基于浏览器的音频与硬件加速的速度与普适性,我们生成具有实时交互性的时变高保真声音。SnakeSynth自适应地复现并插值模型训练期间遇到的声音,显著地无需长训练时间,并简要讨论了深度生成模型作为音乐表达交互范式的可能未来。
引用
@article{arxiv.2307.05830,
title = {SnakeSynth: New Interactions for Generative Audio Synthesis},
author = {Eric Easthope},
journal= {arXiv preprint arXiv:2307.05830},
year = {2023}
}