方言,但多少方言?转录和评估连续统上的方言
计算与语言
2025-11-19 v2
摘要
自然语言处理中对方言的关注日益增加。然而,迄今为止大多数工作仍将方言视为离散类别。例如,面向变异的英语自然语言处理中的评估工作通常将印度英语或非裔美国人白话英语视为同质类别(Faisal et al., 2024; Ziems et al., 2023),但即使在一个变体内部也存在显著的变异。我们研究了方言内部变异,并表明性能在类别内部存在关键性差异。我们测量了意大利方言的语音转文本性能,并经验性地观察到地理性能差异。这种差异与表现最佳的方言变体的语言相似性显著相关(-0.5)。我们使用方言计量方法交叉验证了我们的结果,并将性能差异解释为由于所检查的语音转文本模型对更接近标准变体的方言存在偏差。此外,我们利用地统计学方法预测未见地点的零样本性能,并发现纳入地理信息能显著提高预测性能,表明性能分布中存在地理结构。
引用
@article{arxiv.2410.14589,
title = {Dialetto, ma Quanto Dialetto? Transcribing and Evaluating Dialects on a Continuum},
author = {Ryan Soh-Eun Shim and Barbara Plank},
journal= {arXiv preprint arXiv:2410.14589},
year = {2025}
}
备注
Published in NAACL 2025 findings