中文

代码切换文本是否能激活大语言模型中的知识开关?英语-韩语代码切换案例研究

计算与语言 2025-11-25 v5

摘要

近期大型语言模型(LLMs)展示出多语言能力,但由于训练语料中英语的占主导地位,这些模型仍然是英语中心化的。低资源语言的资源有限仍是一个关键挑战。代码切换(CS),即多语言说话者在话语中交替使用不同语言的现象,能够传递细微的文化和语言细微差异,这些细微差异在翻译中往往会被遗漏,并能在人类交流中引发特定的语言知识。在此基础上,我们研究代码切换是否能够激活或识别并利用知识,以解决低资源语言任务。为促进研究,我们首先提出EnKoQA,即一个人工构建的英语-韩语代码切换问答数据集。我们对各种多语言LLMs进行全面分析,将激活过程分为知识识别和知识利用两个环节。我们的结果表明,与英语文本相比,代码切换能够在语言特定领域忠实地激活LLMs内的知识,表明代码切换在低资源语言任务中具有潜在价值。

关键词

引用

@article{arxiv.2410.18436,
  title  = {Can Code-Switched Texts Activate a Knowledge Switch in LLMs? A Case Study on English-Korean Code-Switching},
  author = {Seoyeon Kim and Huiseo Kim and Chanjun Park and Jinyoung Yeo and Dongha Lee},
  journal= {arXiv preprint arXiv:2410.18436},
  year   = {2025}
}

备注

Accepted to EMNLP 2025 Findings