面向韩国古籍的标点恢复模型与空格模型
计算与语言
2023-12-20 v1 人工智能
摘要
在韩国古籍中,没有空格和标点,并且它们是用文言文(汉字)书写的。这使得现代人和翻译模型难以准确地解释和翻译它们。虽然中国已有预测标点和空格的模型,但由于数据差异,将它们直接应用于韩国文本是有问题的。因此,我们开发了首个预测韩国历史文本标点和空格的模型,并评估了它们的性能。我们的标点恢复模型达到了 0.84 的 F1 分数,空格模型达到了 0.96 的分数。它的优势在于能够在 VRAM 较少的低性能 GPU 上进行推理,同时保持相当高的准确性。
引用
@article{arxiv.2312.11881,
title = {Punctuation restoration Model and Spacing Model for Korean Ancient Document},
author = {Taehong Jang and Joonmo Ahn and Sojung Lucia Kim},
journal= {arXiv preprint arXiv:2312.11881},
year = {2023}
}
备注
5 Pages, 2 Figures