中文

通过应用模糊推理系统对英语单词中的字素进行分类

计算与语言 2024-04-03 v1 计算机科学中的逻辑

摘要

在语言学中,字素是书写系统中对应于语音的书写单位。在自然语言处理任务中,书面语言通过两种不同的媒介进行分析:词分析和字符分析。本文重点关注第三种方法,即字素分析。字素作为语音的独立表示,具有优于词分析和字符分析的优势。由于将单词拆分为字素的性质基于复杂的非二元规则,模糊逻辑的应用将提供一个合适的媒介来预测单词中字素的数量。本文提出应用模糊推理系统将单词拆分为其字素。该模糊推理系统在 50.18% 的情况下能正确预测单词中字素的数量,其中 93.51% 的预测在正确分类的 +- 1 误差范围内。鉴于语言的多样性,字素与发音相关联,因此可能会因地区口音/方言而异,+- 1 的准确率表示在考虑地区差异时字素分类的不精确性。为了提供比较的基线,我们开发了第二种方法,涉及使用发音词典进行递归 IPA 映射练习,以进行比较。

关键词

引用

@article{arxiv.2404.01953,
  title  = {Classifying Graphemes in English Words Through the Application of a Fuzzy Inference System},
  author = {Samuel Rose and Chandrasekhar Kambhampati},
  journal= {arXiv preprint arXiv:2404.01953},
  year   = {2024}
}