Meenz bleibt Meenz,但大型语言模型不会说这种方言
计算与语言
2026-03-05 v3
摘要
Meenzerisch是德国美因茨市的方言,也是美因茨狂欢节的传统语言,这一节日在德国境内广为人知。然而,Meenzerisch正濒临消亡——它与许多其他德国方言一样面临着消亡的命运。自然语言处理(NLP)有潜力帮助语言和方言的保存与复兴。然而,迄今为止尚无NLP研究专注于Meenzerisch。本工作提出了该领域的首个研究,介绍了用于支持研究人员建模和基准测试的语言的数字词典——一个来自现有资源(Schramm, 1966)的NLP就绪数据集。它包含2351个方言词汇,配有以标准德语描述的意义。我们随后使用此数据集回答以下研究问题:(1)状态最先进的大型语言模型(LLMs)能否为方言词生成定义?(2)LLMs能否在给定定义的情况下生成Meenzerisch单词?我们的实验表明,LLMs既不能生成定义,也不能生成单词:最佳定义模型仅达到6.27%准确率,最佳单词生成模型的准确率为1.51%。我们随后进行了两个额外实验,以查看是否通过few-shot学习和从训练集中提取规则(然后传递给LLM)来提高准确率。虽然这些方法能够提高结果,但准确率仍低于10%。这表明,针对德国方言的额外资源和研究力度急需加强。
引用
@article{arxiv.2602.16852,
title = {Meenz bleibt Meenz, but Large Language Models Do Not Speak Its Dialect},
author = {Minh Duc Bui and Manuel Mager and Peter Herbert Kann and Katharina von der Wense},
journal= {arXiv preprint arXiv:2602.16852},
year = {2026}
}
备注
Accepted at LREC 2026