中文

从统计视角重新思考跨语言鸿沟

计算与语言 2025-10-20 v1 人工智能 机器学习

摘要

任何知识通常以一种或少数几种自然语言表达于 web 或大型语料库中。大型语言模型(LLM)作为桥梁,通过获取源语言知识并在查询目标语言时实现访问。先前研究指出跨语言鸿沟,即当知识以目标语言查询时相对于源语言查询的准确率下降。现有研究将源语言和目标语言中潜在表示的差异解释为跨语言鸿沟的原因。本文提出另一观点,假设目标语言响应的方差是此鸿沟的主要原因。首次将跨语言鸿沟形式化为偏差-方差分解。我们 presented 大量实验证据支持所提假设和假设。我们通过控制方差并减少跨语言鸿沟的多种推理时干预来加强我们的假设。我们展示了一种简单提示指令以减少响应方差,使目标准确率在不同模型上提高 20-25%。

关键词

引用

@article{arxiv.2510.15551,
  title  = {Rethinking Cross-lingual Gaps from a Statistical Viewpoint},
  author = {Vihari Piratla and Purvam Jain and Darshan Singh and Partha Talukdar and Trevor Cohn},
  journal= {arXiv preprint arXiv:2510.15551},
  year   = {2025}
}

备注

22 pages