中文

AudioViewer:学习可视化声音

人机交互 2023-02-15 v5 计算机视觉与模式识别 机器学习 声音 音频与语音处理

摘要

感觉替代领域一个长期目标是通过可视化音频内容使聋人和听力障碍(DHH)人士感知声音。不同于现有翻译为手语、语音与文本之间或文本与图像之间的模型,我们面向即时且低层的音频到视频翻译,适用于通用环境声音及人类语音。由于此类替代是人为的,没有监督学习标签,我们的核心贡献是构建从音频到视频的映射,该映射通过高层约束从非配对样本中学习。对于语音,我们额外将内容从风格(如性别和方言)中解耦。定性与定量结果(包括一项人类研究)表明,我们的非配对翻译方法在生成视频中保留了重要音频特征,且人脸与数字视频非常适合可视化可由人类解析以匹配和区分声音与词语的高维音频特征。代码与模型见 https://chunjinsong.github.io/audioviewer。

关键词

引用

@article{arxiv.2012.13341,
  title  = {AudioViewer: Learning to Visualize Sounds},
  author = {Chunjin Song and Yuchi Zhang and Willis Peng and Parmis Mohaghegh and Bastian Wandt and Helge Rhodin},
  journal= {arXiv preprint arXiv:2012.13341},
  year   = {2023}
}