中文

TALL -- 提升低资源语言中大语言模型性能的可训练架构

计算与语言 2025-06-06 v1 人工智能

摘要

大语言模型 (LLM) 在高资源语言中表现出色,但由于训练数据有限,在低资源语言中却面临挑战。本文提出了 TALL (Trainable Architecture for Enhancing LLM Performance in Low-Resource Languages),该模型将 LLM 与两个双语翻译模型集成。TALL 将低资源输入转换为高资源表示,同时通过维度对齐层和自定义转换器保留语言特征。我们在 Hebrew 上进行实验,显著优于多个基线方法,包括直接使用、粗糙翻译和微调方法。该架构采用参数高效策略,冻结预训练组件,仅训练轻量级适配器模块,在计算效率和性能提升之间取得平衡。

关键词

引用

@article{arxiv.2506.05057,
  title  = {TALL -- A Trainable Architecture for Enhancing LLM Performance in Low-Resource Languages},
  author = {Moshe Ofer and Orel Zamler and Amos Azaria},
  journal= {arXiv preprint arXiv:2506.05057},
  year   = {2025}
}