中文

古文标点预测:一种多层 LSTM 与注意力机制的方法

计算与语言 2024-09-18 v1

摘要

直到 20 世纪,中文才开始使用标点符号。事实上,许多古文包含数千行文字,其中没有任何明显的标点符号或分隔符。此类文本中缺乏标点符号使得人类难以识别特定短语之间何时存在停顿或中断,并难以理解书面文本的语义含义(Mogahed, 2012)。因此,除非受过古代时期的教育,否则许多古文读者对文本会有截然不同的理解。我们提出了一种预测古文中标点位置(和类型)的方法,该方法扩展了 Oh 等人(2017)的工作,利用了带有多头注意力机制的双向多层 LSTM,其灵感来自 Luong 等人(2015)对基于注意力架构的讨论。我们发现,在评估古文时,使用多层 LSTM 和多头注意力显著优于不包含此类组件的 RNN。

关键词

引用

@article{arxiv.2409.10783,
  title  = {Predicting Punctuation in Ancient Chinese Texts: A Multi-Layered LSTM and Attention-Based Approach},
  author = {Tracy Cai and Kimmy Chang and Fahad Nabi},
  journal= {arXiv preprint arXiv:2409.10783},
  year   = {2024}
}