超越英语中心的多语言语言模型:它们思考的是什么语言?
计算与语言
2024-08-21 v1 人工智能
摘要
本研究探讨了非英语中心的大型语言模型(LLM),尽管性能卓越,却是否'思考'于其主要语言:更确切地说,'思考'指的是当中间层表示未反映到词汇空间时,生成时对某些主要语言具有更高概率。我们称此类语言为内部latent language。我们考察了三类典型日文处理模型的隐式语言:Llama2(英语中心模型)、Swallow(在日文上进行持续预训练的英语中心模型)以及LLM-jp(在平衡的英语和日文语料上预训练的模型)。我们的实证发现表明,与Llama2唯一依赖英语作为内部隐式语言不同,日文专用Swallow和LLM-jp采用两种语言,表现出双重内部隐式语言。对于给定的目标语言,模型优先激活与其最相关的隐式语言。此外,我们探讨了中间层对涉及隐式内部语言与目标输出语言文化冲突问题的响应方式。我们进一步探讨了在保持语义意义一致的前提下,语言身份如何随层数变化而变化。本研究深化了对非英语中心大型语言模型的理解,突显了其中间层语言表示内在复杂动态。
引用
@article{arxiv.2408.10811,
title = {Beyond English-Centric LLMs: What Language Do Multilingual Language Models Think in?},
author = {Chengzhi Zhong and Fei Cheng and Qianying Liu and Junfeng Jiang and Zhen Wan and Chenhui Chu and Yugo Murawaki and Sadao Kurohashi},
journal= {arXiv preprint arXiv:2408.10811},
year = {2024}
}
备注
work in progress