中文

VFNet:一种用于口音分类的卷积架构

声音 2019-10-16 v1 机器学习 音频与语音处理

摘要

理解口音是可能破坏任何人机交互的问题。口音分类通过识别说话人所带口音,使后续处理能确定所说正确词语,从而简化该任务,因为同一噪声在同一种语言的不同口音中可意指完全不同的词。本文提出VFNet(Variable Filter Net),一种基于卷积神经网络(CNN)的架构,其通过沿音频话语频带施加可变滤波器尺寸这一新颖而简洁的技术,捕获特征层次以超越先前的口音分类基准。

关键词

引用

@article{arxiv.1910.06697,
  title  = {VFNet: A Convolutional Architecture for Accent Classification},
  author = {Asad Ahmed and Pratham Tangri and Anirban Panda and Dhruv Ramani and Samarjit Karmakar},
  journal= {arXiv preprint arXiv:1910.06697},
  year   = {2019}
}

备注

Accepted at IEEE INDICON 2019