中文

基于成对马尔可夫链的高效快速文本分割

计算与语言 2025-08-12 v3 机器学习

摘要

自然语言处理(NLP)模型的当前趋势在于使用越来越多的额外数据来构建尽可能最佳的模型。这导致了更高的计算成本与训练时间、部署困难,以及对于这些模型碳足迹的担忧,揭示出未来的一个关键问题。与这一趋势相反,我们的目标是开发不需要额外数据且最小化训练时间的 NLP 模型。为此,本文中我们探索马尔可夫链模型、隐马尔可夫链(HMC)与成对马尔可夫链(PMC),用于 NLP 分割任务。我们将这些模型应用于三个经典应用:词性标注(POS Tagging)、命名实体识别(Named-Entity-Recognition)和组块分析(Chunking)。我们开发了一种原创方法,使这些模型适应文本分割的特定挑战,从而在极短的训练与执行时间内获得相关性能。PMC 取得了与使用无额外数据的条件随机场(CRF,这些任务中最常用的模型之一)相当的结果。此外,PMC 的训练时间比 CRF 短 30 倍,这在我们既定目标下验证了该模型。

关键词

引用

@article{arxiv.2102.11037,
  title  = {Highly Fast Text Segmentation With Pairwise Markov Chains},
  author = {Elie Azeraf and Emmanuel Monfrini and Emmanuel Vignon and Wojciech Pieczynski},
  journal= {arXiv preprint arXiv:2102.11037},
  year   = {2025}
}

备注

9 pages, 5 figures, 4 tables, MNLP 2020