中文

解构多语言大语言模型任务执行中的语言角色

计算与语言 2026-05-28 v1 机器学习

摘要

当指令、源内容和所需响应语言不一致时,多语言大语言模型的使用日益增多。现有的基准测试扩展了多语言指令跟随评估,但它们很少在全交叉设计中隔离这三个角色。我们引入了MTM-Bench,一个用于语言条件任务执行的受控基准测试,其中每个实例由一个三元组(Linstr,Lcontent,Lresp)(L_{\text{instr}}, L_{\text{content}}, L_{\text{resp}})定义。在英语、西班牙语和中文中,MTM-Bench枚举了所有27个三元组,每个模型包含2,430个实例,涵盖语义反转、最终状态提取以及带更新实现的语言纯度。我们使用分解指标评估了20个前沿和开源大语言模型,这些指标包括语义正确性、目标语言遵循度、约束满足度、污染比率和联合成功率,并通过有针对性的人工审计验证了评分。全交叉设计揭示,性能下降是由语言在任务结构中所扮演的角色组织的,而不仅仅是角色不匹配的数量。响应语言角色是变化的主要轴,单个响应槽位的不匹配导致了大部分性能下降。仅响应不匹配与全不匹配的比较表明,不匹配数量并非难度的单调预测指标,模型级别的排序因系统而异。任务族通过不同的渠道失败,表明仅凭语义正确性无法捕捉可靠的多语言任务执行。

关键词

引用

@article{arxiv.2605.27649,
  title  = {Disentangling Language Roles in Multilingual LLM Task Execution},
  author = {Qishi Zhan and Minxuan Hu and Seoyeon Jang and Lei Zhao and Ziheng Chen and Man Liang and Xinyue Xiang and Jiaxin Liu and Guansu Wang and Liang He},
  journal= {arXiv preprint arXiv:2605.27649},
  year   = {2026}
}