中文

文学与口语泰米尔方言识别

音频与语音处理 2024-08-27 v1 计算与语言 人机交互 机器学习 声音

摘要

文化与语言共同演变。泰米尔语的旧文学形式常用于书写,口语泰米尔则用于日常交流。人机交互应用需要口语泰米尔(CT)以提高可访问性和易用性,而在需要正式书面信息时则需要文学泰米尔(LT)。在计算机辅助语言学习应用中,同时使用 LT 与 CT 不仅能保留 LT,还能通过 CT 提供便捷性。因此,需要在两种方言之间进行转换,这要求首先进行方言识别。文学泰米尔与口语泰米尔的方言识别(DID)是尚未探索的研究领域。本文考虑到两种方言的细微差异,探索了五种方法,包括两种隐式方法——高斯混合模型(GMM)和卷积神经网络(CNN);两种显式方法——平行电话识别(PPR)和平行大词表连续语音识别(P-LVCSR);以及两种版本的 proposed explicit Unified Phone Recognition 方法(UPR-1 和 UPR-2)。这些方法在是否需要注释数据、单元大小、建模方式以及最终决策方式方面存在差异。尽管测试语音时长较短——LT 为 4.9 秒,CT 为 2.5 秒——各系统表现良好,分别实现了以下识别准确率:87.72%(GMM),93.97%(CNN),89.24%(PPR),94.21%(P-LVCSR),88.57%(UPR-1),93.53%(UPR-1 结合 P-LVCSR),94.55%(UPR-2),95.61%(UPR-2 结合 P-LVCSR)。

关键词

引用

@article{arxiv.2408.13739,
  title  = {Literary and Colloquial Tamil Dialect Identification},
  author = {M. Nanmalar and P. Vijayalakshmi and T. Nagarajan},
  journal= {arXiv preprint arXiv:2408.13739},
  year   = {2024}
}

备注

18 pages, 6 figures, submitted to "Circuits, Systems, and Signal Processing"