中文

论语音与音乐的表示

声音 2019-05-10 v1 音频与语音处理 统计方法学

摘要

在大多数自动语音识别 (ASR) 系统中,音频信号经过处理以产生传感器测量值的时间序列(例如滤波器组输出)。该时间序列以依赖于说话人的方式编码语义信息。先前的一篇论文展示了如何使用传感器测量值序列推导出一个不受传感器测量值的任何先前可逆变换影响的“内部”时间序列。本文考虑两个或更多说话人,他们在以下意义上相互模仿:当说出相同词语时,他们产生的传感器状态可逆地映射到彼此。由此可知,当他们说出相同词语时,其话语的内部时间序列必然相同。换言之,内部时间序列以独立于说话人的方式编码其语音。因此,ASR 训练过程可以通过仅收集和标注单一说话人话语的内部时间序列来简化,而无需在大量不同说话人话语的传感器时间序列上进行训练。类似的论证表明,音乐的内部时间序列是独立于乐器的。这在单声道电子音乐的实验中得到了证明。

关键词

引用

@article{arxiv.1905.03278,
  title  = {On the representation of speech and music},
  author = {David N. Levin},
  journal= {arXiv preprint arXiv:1905.03278},
  year   = {2019}
}

备注

6 pages, 6 figures