中文

语音算法在微文本规范化中的性能研究

计算与语言 2024-02-06 v1

摘要

发布在微博客社交网络上的用户生成内容构成了无价的信息来源。然而,微文本通常偏离语言的标准词汇和语法规则,使得传统智能系统难以对其进行处理。作为回应,微文本规范化旨在将这些非标准微文本转换为标准的书写文本,作为预处理步骤,从而使传统方法能够继续其常规处理。鉴于语音现象在非标准文本形成中的重要性,规范化器知识库的一个基本要素应是编码这些现象的语音规则,而这些规则存在于所谓的语音算法中。在本工作中,我们对多种英语语音算法进行了实验。本研究旨在确定在微文本规范化候选生成背景下最佳的语音算法。换言之,我们试图找到那些以待规范化的非标准术语为输入,能够输出包含相应目标标准词的最小可能候选集的算法。正如将要阐述的那样,语音算法的选择将很大程度上取决于候选选择机制的能力,该机制通常位于微文本规范化流程的末端。候选选择机制在足够大的候选集中做出正确选择的速度越快,我们就越可以牺牲语音算法的精度以换取覆盖率,从而提高规范化系统的整体性能。

关键词

引用

@article{arxiv.2402.02591,
  title  = {On the performance of phonetic algorithms in microtext normalization},
  author = {Yerai Doval and Manuel Vilares and Jesús Vilares},
  journal= {arXiv preprint arXiv:2402.02591},
  year   = {2024}
}

备注

Accepted for publication in journal Expert Systems with Applications