中文

让每个字母都有价值:从单语语料构建方言变体词典

计算与语言 2025-09-23 v1

摘要

方言由于缺乏标准拼写体系,呈现出显著的变异性。同时,大型语言模型(LLM)处理方言的能力仍有待深入研究。为填补这一空白,我们以巴伐利亚方言为案例,研究 LLM 在识别和翻译不同词性的方言词汇方面的能力。为此,我们提出了 DiaLemma,一种 novel 的注释框架,用于仅从单语数据构建方言变体词典,并据此编译了由 10 万人工标注的德语-巴伐利亚词对基准数据集。我们评估了九种主流 LLM 判别巴伐利亚词汇是否为德语词根的方言翻译、变体形式或无关形式的能力。我们的结果表明,LLM 在名词和词义相似的词对方面表现最佳,在区分直接翻译与变体形式方面表现最差。有趣的是,提供额外语境(如例句用法)可提高翻译性能,但会削弱其识别方言变体的能力。这一研究凸显了 LLM 在处理拼写变体方言方面的局限性,强调了未来适配方言的必要性。

关键词

引用

@article{arxiv.2509.17855,
  title  = {Make Every Letter Count: Building Dialect Variation Dictionaries from Monolingual Corpora},
  author = {Robert Litschko and Verena Blaschke and Diana Burkhardt and Barbara Plank and Diego Frassinelli},
  journal= {arXiv preprint arXiv:2509.17855},
  year   = {2025}
}

备注

Accepted at EMNLP 2025 (Findings)