语言变体间的信息不对称:粤语-普通话和巴伐利亚语-德语问答的案例研究
计算与语言
2026-03-17 v1
摘要
大型语言模型 (LLM) 正成为人类寻求知识的常见方式,但其覆盖范围和可靠性差异很大。特别是对于地方语言变体,存在很大的不对称性,例如,地方维基百科中的信息在标准变体中不存在。然而,关于 LLM 在这种信息不对称下表现如何,尤其是在密切相关的语言上,我们知之甚少。我们手动构建了一个新颖的挑战性问答 (QA) 数据集,该数据集捕捉了地方维基百科页面上传达的知识,而这些知识在其资源更丰富的对应版本中是不存在的——涵盖普通话 vs. 粤语和德语 vs. 巴伐利亚语。我们的实验表明,LLM 无法回答仅存在于地方版维基百科中的信息问题。提供来自引导部分的上下文可以显著提高性能,通过翻译可以获得进一步的提升。我们的主题、地理注释和分层评估揭示了地方维基百科版本作为区域和全球信息来源的有用性。这些发现引发了关于 LLM 的包容性和文化覆盖的关键问题。
引用
@article{arxiv.2603.14782,
title = {Information Asymmetry across Language Varieties: A Case Study on Cantonese-Mandarin and Bavarian-German QA},
author = {Renhao Pei and Siyao Peng and Verena Blaschke and Robert Litschko and Barbara Plank},
journal= {arXiv preprint arXiv:2603.14782},
year = {2026}
}
备注
23 pages, accepted at LREC 2026 as an oral presentation