中文

基于1D-CNN的文学与口语泰米尔语语音分类特征工程方法

音频与语音处理 2024-09-24 v1 机器学习 声音

摘要

在理想的人机交互中,用户更倾向于使用口语化形式的语言,因为这是他们日常对话中使用的形式。然而,也不可否认地需要保存正式的文学形式。通过 embracing 新形式和保留旧形式,可以同时实现服务大众(实用性)和服务语言本身(保育)。因此,计算机理想的能力是根据需要接受、处理和交谈两种语言形式。为此,首先有必要识别输入语音的形式,这在当前工作中位于文学泰米尔语和口语泰米尔语之间。这种前端系统必须包含一个简单、有效且轻量级的分类器,其在几组有效特征上进行训练,能够捕捉语音信号的底层模式。为实现这一目标,提出了一种一维卷积神经网络(1D-CNN),其在时间上学习特征的包络。该网络首先在精选的手工特征上进行训练,然后在梅尔频率倒数谱系数(MFCC)上进行比较。手工特征被选取以解决语音的各个方面问题,包括谱特征、时序特征、韵律和语音质量。这些特征最初考虑十个平行语音,并观察每个特征相对于时间的趋势。使用手工特征训练的所提出的1D-CNN获得了0.9803的F1分数,而使用MFCC训练的1D-CNN获得了0.9895的F1分数。鉴于此,探索了特征消除和特征组合。当从特征消除研究中获得最佳排序的手工特征与MFCC组合时,能够获得最佳结果,F1分数为0.9946。

关键词

引用

@article{arxiv.2409.14348,
  title  = {A Feature Engineering Approach for Literary and Colloquial Tamil Speech Classification using 1D-CNN},
  author = {M. Nanmalar and S. Johanan Joysingh and P. Vijayalakshmi and T. Nagarajan},
  journal= {arXiv preprint arXiv:2409.14348},
  year   = {2024}
}