视觉拟声成波:基于视觉拟声词与声源图像的环境音合成
声音
2022-10-18 v1 音频与语音处理
摘要
我们提出了一种从视觉化表示的拟声词与声源合成环境音的方法。拟声词是模仿声音结构的词,即声音的文本表示。基于此,已有研究提出 onoma-to-wave 方法,从期望的拟声词文本合成环境音。拟声词还有另一种表示:漫画、广告和虚拟现实中的声音视觉-文本表示。视觉拟声词(拟声词的视觉文本)包含文本所不具备的丰富信息,例如图像的时长长短,因此有望利用该表示合成多样的声音。为此,我们提出 visual onoma-to-wave,用于从视觉拟声词合成环境音。该方法可将视觉文本的视觉概念与声源图像迁移至合成声音中。我们还提出了一种聚焦于拟声词重复的增强数据方法,以提升本方法性能。实验评估表明,该方法能从视觉文本与声源图像合成多样的环境音。
引用
@article{arxiv.2210.09173,
title = {Visual onoma-to-wave: environmental sound synthesis from visual onomatopoeias and sound-source images},
author = {Hien Ohnaka and Shinnosuke Takamichi and Keisuke Imoto and Yuki Okamoto and Kazuki Fujii and Hiroshi Saruwatari},
journal= {arXiv preprint arXiv:2210.09173},
year = {2022}
}
备注
Submitted to ICASSP 2023