LLM是否至少能维持语言种属关系?
计算与语言
2025-10-27 v1
摘要
大型语言模型(LLMs)在多语言行为上显示出显著差异,但基因级语言结构在塑造这种差异方面仍未得到充分探讨。本文通过扩展先前在MultiQ数据集上的分析,研究LLM是否表现出对语言种属关系的敏感性。我们首先检查模型在提示语言保真度未被维持时,是否倾向于切换到与之相关的语言。接着,我们探讨知识一致性是否在同一种系内优于跨系。我们表明,种属水平效应存在,但严重取决于训练资源 availability。我们进一步观察到不同LLM家族之间存在不同的多语言策略。我们的发现表明,LLM编码了部分种属水平结构,但训练数据不平衡仍是塑造其多语言性能的主要因素。
引用
@article{arxiv.2510.21561,
title = {Are the LLMs Capable of Maintaining at Least the Language Genus?},
author = {Sandra Mitrović and David Kletz and Ljiljana Dolamic and Fabio Rinaldi},
journal= {arXiv preprint arXiv:2510.21561},
year = {2025}
}