中文

EMCee:通过提取合成多语言语境桥接知识与推理以提升LLM多语言能力

计算与语言 2025-10-20 v2 人工智能

摘要

大型语言模型(LLMs)在广泛的任务中取得了令人瞩目的进展,然而它们严重依赖以英语为中心的训练数据,导致在非英语语言中性能显著下降。现有的多语言提示方法强调将查询转换为英语或增强推理能力,但往往未能纳入某些查询所必需的特定语言和文化背景。为了解决这一局限性,我们提出了EMCee(Extracting synthetic Multilingual Context and merging,提取合成多语言语境并合并),这是一个简单而有效的框架,通过从LLM本身显式提取并利用与查询相关的知识来增强LLM的多语言能力。具体而言,EMCee首先提取合成语境以揭示LLM中编码的潜在特定语言知识,然后通过基于判断的选择机制,将这种语境洞察与面向推理的输出动态合并。在涵盖多种语言和任务的四个多语言基准上的广泛实验表明,EMCee持续优于先前的方法,总体平均相对提升16.4%,在低资源语言中提升31.7%。

关键词

引用

@article{arxiv.2503.05846,
  title  = {EMCee: Improving Multilingual Capability of LLMs via Bridging Knowledge and Reasoning with Extracted Synthetic Multilingual Context},
  author = {Hamin Koo and Jaehyung Kim},
  journal= {arXiv preprint arXiv:2503.05846},
  year   = {2025}
}

备注

under review, 21pages