VFNet:一种用于口音分类的卷积架构
声音
2019-10-16 v1 机器学习
音频与语音处理
摘要
理解口音是可能破坏任何人机交互的问题。口音分类通过识别说话人所带口音,使后续处理能确定所说正确词语,从而简化该任务,因为同一噪声在同一种语言的不同口音中可意指完全不同的词。本文提出VFNet(Variable Filter Net),一种基于卷积神经网络(CNN)的架构,其通过沿音频话语频带施加可变滤波器尺寸这一新颖而简洁的技术,捕获特征层次以超越先前的口音分类基准。
引用
@article{arxiv.1910.06697,
title = {VFNet: A Convolutional Architecture for Accent Classification},
author = {Asad Ahmed and Pratham Tangri and Anirban Panda and Dhruv Ramani and Samarjit Karmakar},
journal= {arXiv preprint arXiv:1910.06697},
year = {2019}
}
备注
Accepted at IEEE INDICON 2019