中文

BhashaSetu:从高资源语言向极端低资源语言的跨语言知识迁移

人工智能 2026-02-06 v1 计算与语言 机器学习

摘要

尽管自然语言处理领域取得了显著进展,但为低资源语言开发有效系统仍是巨大挑战,由于数据稀缺和语言资源不足,性能通常远落后于高资源语言。跨语言知识迁移已成为应对这一挑战的有前景方法,能够利用高资源语言的资源。本文探讨了将语言知识从高资源语言迁移到低资源语言的方法,后者的标记训练实例数量仅为数百个。我们关注句子级和词级任务。我们提出了一种新方法,GETR(Graph-Enhanced Token Representation),用于跨语言知识迁移,同时采用两种既有基线方法:(a)隐藏层数据增强;(b)通过 token 翻译实现 token 嵌入迁移。实验结果表明,基于图神经网络的 GETR 方法显著优于现有多语言和跨语言基线方法,在 POS 标注任务中对真正低资源语言(Mizo、Khasi)提升最高可达 13 个百分点;在情感分类和命名实体识别任务中,对模拟低资源语言(Marathi、Bangla、Malayalam)的 macro-F1 分数提升分别达到 20 和 27 个百分点。我们还对迁移机制进行了详细分析,确定了该语言语境下成功知识迁移的关键因素。

关键词

引用

@article{arxiv.2602.05599,
  title  = {BhashaSetu: Cross-Lingual Knowledge Transfer from High-Resource to Extreme Low-Resource Languages},
  author = {Subhadip Maji and Arnab Bhattacharya},
  journal= {arXiv preprint arXiv:2602.05599},
  year   = {2026}
}

备注

Accepted as a long paper at IJCNLP-AACL Main Conference