中文

基于IndicKLAR评估印度语言中跨语言知识一致性的面向代码混合文本

计算与语言 2026-05-29 v1

摘要

大型语言模型在英文中可靠地记忆知识,但在更低资源语言中常常失败——这一跨语言一致性差距在印度语言及其代码混合变体中仍未得到充分探索。为研究这一差距,我们引入IndicKLAR,印度语言版本的KLAR-CLC基准,覆盖 22 种官方语言中的 18 种语言,并为这 11 对语言对中的每种语言配对其代码混合变体,由母语者验证单语和代码混合变体。这种三向对齐为检查知识记忆一致性在英语、代码混合和本土印度语言输入谱系中的变化提供了独特机会。在九个开源模型中进行评估,我们发现本土语言与英文之间的准确度差距可达约 0.50,而代码混合输入大幅缩小这一差距——在无需模型层面干预的情况下,将性能拉近至约 0.05。受此启发,我们评估了几种不同的提示策略,包括两阶段翻译后回答设置、单阶段联合翻译与回答提示,以及 Translate-in-Thought(TinT)——一种单步骤策略,其中模型在内部转换输入仅输出最终答案。在本土→代码混合→英文的性能轨迹中,我们识别出一个一致的翻转点——错误预测与正确预测之间的边界——位于本土和代码混合设置之间。有趣的是,这一现象无论是通过输入表面形式诱导还是通过模型的内部转换过程诱导,都如此。

关键词

引用

@article{arxiv.2605.29637,
  title  = {Evaluating Cross-lingual Knowledge Consistency in Code-Mixed vis-a-vis Indian Languages using IndicKLAR},
  author = {Debajyoti Mazumder and Divyansh Pathak and Prashant Kodali and Aditya Joshi and Akshay Agarwal and Jasabanta Patro},
  journal= {arXiv preprint arXiv:2605.29637},
  year   = {2026}
}

备注

23 pages