中文

面向韩国古籍的标点恢复模型与空格模型

计算与语言 2023-12-20 v1 人工智能

摘要

在韩国古籍中,没有空格和标点,并且它们是用文言文(汉字)书写的。这使得现代人和翻译模型难以准确地解释和翻译它们。虽然中国已有预测标点和空格的模型,但由于数据差异,将它们直接应用于韩国文本是有问题的。因此,我们开发了首个预测韩国历史文本标点和空格的模型,并评估了它们的性能。我们的标点恢复模型达到了 0.84 的 F1 分数,空格模型达到了 0.96 的分数。它的优势在于能够在 VRAM 较少的低性能 GPU 上进行推理,同时保持相当高的准确性。

关键词

引用

@article{arxiv.2312.11881,
  title  = {Punctuation restoration Model and Spacing Model for Korean Ancient Document},
  author = {Taehong Jang and Joonmo Ahn and Sojung Lucia Kim},
  journal= {arXiv preprint arXiv:2312.11881},
  year   = {2023}
}

备注

5 Pages, 2 Figures