HanjaBridge:通过汉字增强预训练解决韩语大语言模型中的语义歧义
计算与语言
2025-07-16 v1 人工智能
摘要
大型语言模型(LLM)在资源有限的语言如韩语方面往往表现不佳,部分原因是独特的语言挑战,例如谐音汉语词在韩文字母(Hangul)中难以区分。为解决此语义歧义问题,我们提出了 HanjaBridge,这是一种集成到持续预训练(CPT)框架中的新型含义注入技术。与其确定性地将一个词映射到单个汉字(中文字符),HanjaBridge 向模型呈现给定同形词的所有可能汉字候选,从而鼓励模型学习语境下的消歧。该过程配合基于 token 的知识蒸馏,以防止灾难性遗忘。实验结果表明,HanjaBridge 显著提升了韩语语言理解能力,在 KoBALT 框架上实现了 21% 的相对改进。值得注意的是,通过强化韩语与中文之间由于共享汉字而产生的语义对齐,我们观察到强烈的跨语言迁移。此外,即使在推理时省略汉字增强,仍能保持这些收益,从而实现实际效率,无需额外运行时开销。
引用
@article{arxiv.2507.10920,
title = {HanjaBridge: Resolving Semantic Ambiguity in Korean LLMs via Hanja-Augmented Pre-Training},
author = {Seungho Choi},
journal= {arXiv preprint arXiv:2507.10920},
year = {2025}
}