通过可逆音转实现跨语言迁移:基于赫夫曼编码的低资源语言方法
计算与语言
2025-09-23 v1
摘要
随着大型语言模型(LLM)在越来越多样化和广泛的多语言语料库上进行训练,它们展示出跨语言迁移能力。然而,这些能力往往难以有效扩展到低资源语言,尤其是那些使用非拉丁字符的语言。将低资源语言音转为拉丁字符是一种自然的解决方案,但目前缺乏将音转集成到LLM训练和部署中的综合框架。本文采用务实方法,创新性地将字符音转与赫夫曼编码相结合,设计了一个完整的音转框架。我们提出的框架具有以下优势:1)压缩:减少低资源语言内容的存储需求,实现文件大小降低最高50%,标记数降低50%-80%。2)准确性:保证音转后文本到源语言100%无损转换。3)效率:消除对低资源语言词汇扩展的需求,提高训练和推理效率。4)可扩展性:该框架可扩展到其他低资源语言。我们在多个下游任务上验证了该框架的有效性,包括文本分类、机器阅读理解和机器翻译。实验结果表明,我们的方法显著增强了模型处理低资源语言的能力,同时保持对高资源语言的性能。我们的数据和代码已公开于 https://github.com/CMLI-NLP/HuffmanTranslit。
引用
@article{arxiv.2509.17493,
title = {Enhancing Cross-Lingual Transfer through Reversible Transliteration: A Huffman-Based Approach for Low-Resource Languages},
author = {Wenhao Zhuang and Yuan Sun and Xiaobing Zhao},
journal= {arXiv preprint arXiv:2509.17493},
year = {2025}
}