中文

基于大语言模型的双语词典归纳研究

计算与语言 2024-02-27 v2 人工智能 信息检索 机器学习

摘要

双语词典归纳(BLI)是多语言NLP中的一项核心任务,其在很大程度上仍依赖于计算跨语言词表示。受NLP领域向大语言模型(LLMs)全球范式转变的启发,我们考察了最新一代LLM在构建双语词典方面的潜力。我们提出以下研究问题:是否可以对多语言LLM(mLLM)进行提示与微调以用于BLI,以及该方法相较于当前BLI方法表现如何、如何与之互补?为此,我们系统地研究了1)用于无监督BLI的零样本提示,2)使用一组种子翻译对的少样本上下文提示(均不对LLM进行微调),以及3)对较小LLM的标准BLI导向微调。我们在两个涵盖一系列类型学多样语言的标准BLI基准上,对18个不同规模(从0.3B到13B参数)的开源文本到文本mLLM进行了实验。我们的工作是首个展示文本到文本mLLM具有强大BLI能力的研究。结果表明,利用来自最近邻的上下文示例进行少样本提示取得了最佳性能,为许多语言对确立了新的SOTA BLI分数。我们还进行了一系列深入分析与消融研究,提供了关于使用(m)LLM进行BLI的更多见解及其局限性。

关键词

引用

@article{arxiv.2310.13995,
  title  = {On Bilingual Lexicon Induction with Large Language Models},
  author = {Yaoyiran Li and Anna Korhonen and Ivan Vulić},
  journal= {arXiv preprint arXiv:2310.13995},
  year   = {2024}
}

备注

EMNLP 2023 Main Conference