让大型语言模型说话给 Tulu:极低资源语言的结构化提示
计算与语言
2026-02-18 v1
摘要
大型语言模型能否在几乎不存在于其训练数据中的语言中进行对话?我们通过对 Tulu——这是一个拥有超过 200 万说话者但数字存在最小的南部古拉德语的案例研究来探索此问题。我们检讨了是否可以通过受控提示alone 能否在没有微调 LLM 的情况下引出基本的对话能力。我们系统性地通过结合显式语法文档、负面约束来抑制来自相关语言的高概率 token、罗马化标准化以及通过自我对弈实现的质量受控合成数据生成来解决 Tulu 训练数据缺失所提出的各种挑战。我们在三个 LLM(Gemini 2.0 Flash、GPT-4o、Llama 3.1 70B)上进行评估,并通过本土说话者验证,我们的方法将词汇污染从 80% 降至 5%,同时实现 85% 的语法准确率。跨模型分析显示,负面约束提供了一致的改进(12--18 个百分点),而语法文档效果因模型架构而异(8--22 个百分点)。
引用
@article{arxiv.2602.15378,
title = {Making Large Language Models Speak Tulu: Structured Prompting for an Extremely Low-Resource Language},
author = {Prathamesh Devadiga and Paras Chopra},
journal= {arXiv preprint arXiv:2602.15378},
year = {2026}
}
备注
Accepted to EACL LoResLM Workshop