超越早期词元偏置:多语言LLM中的模型特定与语言特定位置效应
计算与语言
2025-12-15 v3 机器学习
摘要
大型语言模型(LLM)在系统性地对基于上下文中位置位置信息的权重不足时表现出位置偏置,但这种偏差如何在不同语言和模型之间变化仍不清楚。我们在五种类型多样的语言(英语、俄语、德语、印地语、越南语)和五种模型架构上进行了多语言研究,分析位置偏差如何与提示策略相互作用并影响输出熵。我们的关键发现包括:(1)位置偏差主要由模型驱动,但显示出语言特定的细微差别。值得注意的是,Qwen2.5-7B-Instruct、DeepSeek 7B Chat和Mistral 7B一致偏好后续位置,挑战了关于通用早期词元偏好的常见假设。(2)在存在无关干扰项的情况下,明确指示模型“最相关的上下文信息被标记为1”,意外地降低了所有语言的准确率,质疑了标准提示工程实践。(3)当相关信息出现在上下文中间时,准确率始终下降得最明显,但这未在输出熵中得到相应增加,表明模型即使未使用中间上下文线索仍保持自信。
引用
@article{arxiv.2505.16134,
title = {Beyond Early-Token Bias: Model-Specific and Language-Specific Position Effects in Multilingual LLMs},
author = {Mikhail Menschikov and Alexander Kharitonov and Maiia Kotyga and Vadim Porvatov and Anna Zhukovskaya and David Kagramanyan and Egor Shvetsov and Evgeny Burnaev},
journal= {arXiv preprint arXiv:2505.16134},
year = {2025}
}