多语言 LLM 是否表现如多语言人或众多单语人?价值导向多选题的多语言回答研究
计算与语言
2026-02-06 v1
摘要
多选题常用于评估大语言模型(LLM)中编码的知识、推理能力甚至价值观。虽然已研究过多语言对 LLM 事实记忆的影响,但本文旨在探讨语言引起的价值导向多选题回答的变异问题。多语言 LLM 在不同语言下的回答是否一致,即表现为理论上的多语言人,还是像众多单语模型一样,根据问题的语言表达不同价值观?我们发布了一个新语料库——《欧洲价值调查》(MEVS),该语料库不同于以机器翻译或临时提示为导向的先前工作,仅包含在 8 种欧洲语言中人工翻译的调查问题。我们将部分问题在包括超过三十个不同尺寸、制造商和对齐微调状态的多语言 LLM 上进行测试,综合、受控的提示变体包括答案顺序、符号类型和尾部字符。我们的结果表明,虽然较大的指令微调模型显示更高的整体一致性,但其回答的鲁棒性在不同问题间差异很大,某些多选题在模型内部及跨模型之间完全达成一致,而其他问题则导致 LLM 回答分裂。语言特定行为似乎在所有一致的指令微调模型中都出现,但仅在特定问题上,这凸显了对偏好微调选择性效应的进一步研究的必要性。
引用
@article{arxiv.2602.05932,
title = {Polyglots or Multitudes? Multilingual LLM Answers to Value-laden Multiple-Choice Questions},
author = {Léo Labat and Etienne Ollion and François Yvon},
journal= {arXiv preprint arXiv:2602.05932},
year = {2026}
}
备注
17 pages, 5 figures (8 pages of references and appendices)