DialectGen:面向多模态生成的方言鲁棒性基准测试与提升
计算与语言
2026-04-08 v3 计算机视觉与模式识别
机器学习
摘要
如英语等接触语言 exhibits rich regional variations in the form of dialects,这些方言常被方言说话者用于与生成模型交互。然而,当前的多模态生成模型能否有效地针对方言文本输入生成内容尚不明确。本文通过构建一个覆盖六种常见英语方言的大型基准测试,来研究这一问题。我们与方言说话者合作,收集并验证了超过 4200 条唯一提示,在 17 个图像和视频生成模型上进行评估。我们的自动和人类评估结果显示,当前的 state-of-the-art 多模态生成模型在提示中使用单个方言词汇时,性能会下降 32.26%至 48.17%。常见的缓解方法,如微调和提示重写,只能将方言性能提高少量 (< 7%),同时可能在 Standard American English (SAE) 性能上造成显著下降。为此,我们设计了一种通用的基于编码器的缓解策略,用于多模态生成模型。该方法教会模型识别新的方言特征,同时保持 SAE 性能。在诸如 Stable Diffusion 1.5 等模型上进行实验,我们的方法能够同时将五种方言的性能提升至与 SAE 持平 (+34.4%),同时几乎不影响 SAE 性能。
引用
@article{arxiv.2510.14949,
title = {DialectGen: Benchmarking and Improving Dialect Robustness in Multimodal Generation},
author = {Yu Zhou and Sohyun An and Haikang Deng and Da Yin and Clark Peng and Cho-Jui Hsieh and Kai-Wei Chang and Nanyun Peng},
journal= {arXiv preprint arXiv:2510.14949},
year = {2026}
}