中文

远出:评估澳大利亚英语和印度英语中的语言模型对俚语的理解

计算与语言 2026-02-19 v2 人工智能

摘要

语言模型在处理非标准语言变体时表现出系统性差距,然而其理解特定变体俚语的能力在多个语言中仍未得到充分探索。我们对印度英语 (en-IN) 和澳大利亚英语 (en-AU) 中俚语意识的表现进行了全面评估。我们构建了两个互补数据集:WEB 数据集包含 377 个来自 Urban Dictionary 的网页来源用例,GEN 数据集包含 1,492 个合成生成的这些俚语用法,涵盖多样场景。我们对语言模型进行了三项任务评估:目标词预测 (TWP)、引导目标词预测 (TWP^*) 和目标词选择 (TWS)。我们的结果揭示了四项关键发现:(1) TWS 平均性能高于 TWP 和 TWP^*,平均准确率从 0.03 提升至 0.49;(2) WEB 数据集上的平均性能显著高于 GEN 数据集,TWP 和 TWP^* 任务中平均相似度分别提升 0.03 和 0.05;(3) 在所有模型和数据集上,en-IN 任务平均表现优于 en-AU,TWS 展示了最大的差异,平均准确率从 0.44 提升至 0.54。这些发现凸显了即便在英语这一技术发达的语言中,针对特定语言变体的生成式与判别式能力也存在根本性不对称,尤其是在俚语表达方面。

关键词

引用

@article{arxiv.2602.15373,
  title  = {Far Out: Evaluating Language Models on Slang in Australian and Indian English},
  author = {Deniz Kaya Dilsiz and Dipankar Srirag and Aditya Joshi},
  journal= {arXiv preprint arXiv:2602.15373},
  year   = {2026}
}

备注

Accepted as a paper at 13th VarDial workshop at EACL 2026