Aya-23 思考什么语言?多语言性如何影响内部语言表征
计算与语言
2025-07-29 v1
摘要
大型语言模型(LLM)在多语言任务中表现卓越,但其内部语言处理机制仍鲜有了解。我们分析了 Aya-23-8B——一个在均衡多语言数据上训练的解码器型 LLM——如何处理代码混合、遮盖和翻译任务,与以单一语言为主的模型(如 Llama 3 和 Chinese-LLaMA-2)进行比较。通过 logit lens 和神经元专门化分析,我们发现:(1)Aya-23 在翻译任务中激活与语言在结构上相关的表征,而非以英语为中心的模型依赖单一枢纽语言;(2)代码混合神经元的激活模式随混合比例变化,并更受基准语言影响;(3)Aya-23 对代码混合输入的语言特定神经元集中于后续层,与先前关于解码器型模型的发现不同。神经元重叠分析进一步表明,脚本相似性和结构关系对不同模型类型的处理具有影响。这些发现揭示了多语言训练如何塑造 LLM 的内部表征,为未来的跨语言迁移研究提供了依据。
引用
@article{arxiv.2507.20279,
title = {What Language(s) Does Aya-23 Think In? How Multilinguality Affects Internal Language Representations},
author = {Katharina Trinley and Toshiki Nakai and Tatiana Anikina and Tanja Baeumel},
journal= {arXiv preprint arXiv:2507.20279},
year = {2025}
}
备注
pre-print