中文

LLM 代理能否像语言学家一样识别说话方言?

计算与语言 2026-04-01 v1

摘要

由于标记化说话方言稀缺,音频方言分类是大多数语言(包括瑞士德语)的挑战。本文探讨了大型语言模型 (LLM) 作为理解方言的代理人,其能力是否与诸如 HuBERT 等模型在方言分类方面相当。此外,我们提供了一个 LLM 基准和一个人类语言学家基准。我们的方法使用 ASR 系统产生的语音转文字,并将其与语言资源(如方言特征图、元音历史和规则)结合。我们的发现表明,在提供语言信息时,LLM 预测会得到改善。人类基准显示,自动生成的转文字对此类分类有益,但也 presents 改进的机会。

关键词

引用

@article{arxiv.2603.29541,
  title  = {Can LLM Agents Identify Spoken Dialects like a Linguist?},
  author = {Tobias Bystrich and Lukas Hamm and Maria Hassan and Lea Fischbach and Lucie Flek and Akbar Karimi},
  journal= {arXiv preprint arXiv:2603.29541},
  year   = {2026}
}

备注

Accepted to DialRes Workshop @ LREC 2026