HERITAGE:处理韩文汉字历史文献的端到端 Web 平台
计算与语言
2025-01-22 v1
摘要
尽管韩文历史文献是不可磨损的文化遗产,但要理解这些文献需要深入的汉字 expertise。汉字是韩国在 20 世纪之前使用的古代语言,其字符源自古代中文,但在韩国发展演变了数百年。现代韩语和中文国际语者若不获得额外帮助,无法理解韩文历史文献。虽然已有一些韩语和英文翻译 efforts,但需要深入的 expertise,因此大多数文献尚未翻译成现代语言。为填补这一差距,我们提出 HERITAGE,这是首个开源的汉字 NLP 工具包,用于辅助理解和翻译未被探索的韩文历史文献。HERITAGE 是一个基于 Web 的平台,通过汉字语言模型提供三项关键任务的模型预测:标点恢复、命名实体识别和机器翻译 (MT)。HERITAGE 还提供一个交互式词汇表,提供汉字字符在现代韩语中的字符级读音,以及字符级英文定义。HERITAGE 有两个用途:首先,任何对这些文献感兴趣的人都能通过模型预测和交互式词汇表获得一般性理解,尤其是韩语和英文的 MT 输出;其次,由于模型输出并非完美,汉字专家可以对其进行修订,以产生更好的注释和翻译。这将提高翻译效率,potentially 让大多数历史文献被翻译成现代语言,降低对未被探索的韩文历史文献的门槛。
引用
@article{arxiv.2501.11951,
title = {HERITAGE: An End-to-End Web Platform for Processing Korean Historical Documents in Hanja},
author = {Seyoung Song and Haneul Yoo and Jiho Jin and Kyunghyun Cho and Alice Oh},
journal= {arXiv preprint arXiv:2501.11951},
year = {2025}
}
备注
Demo and video are available at https://hanja.dev and https://hanja.dev/video