中文

探索非拉丁脚本低资源语言中翻译转写在零样本学习中的作用

计算与语言 2024-07-03 v1 人工智能

摘要

解码器模式大型语言模型 (LLM) 在各种任务中通过零样本或少样本零时学习 (ICL) 在高资源语言中表现优异。然而,其性能往往难以在低资源语言上良好迁移,尤其是非拉丁脚本的语言。针对最近利用翻译转写处理编码器模式模型的工作,本文研究翻译转写是否也能提高非拉丁脚本低资源语言中 LLM 的性能。为此,我们提出三种提示模板,代表性语言文本以 (1) 原有脚本、(2) 拉丁脚本或 (3) 两种脚本混合表示。我们将这些方法应用于不同规模的多个代表性 LLM,并在包括文本分类和序列标注等多个任务上进行测试。我们的发现表明,翻译转写的有效性因任务类型和模型规模而异。例如,所有模型在序列标注任务中均受益于翻译转写,提升幅度可达 25%。

关键词

引用

@article{arxiv.2407.02320,
  title  = {Exploring the Role of Transliteration in In-Context Learning for Low-resource Languages Written in Non-Latin Scripts},
  author = {Chunlan Ma and Yihong Liu and Haotian Ye and Hinrich Schütze},
  journal= {arXiv preprint arXiv:2407.02320},
  year   = {2024}
}