评估孟加拉方言偏差的基准测试:集成 RAG-based 翻译与人类增强 RLAIF 的多阶段框架
计算与语言
2026-03-24 v1 人工智能
计算机与社会
摘要
大语言模型 (LLM) 常常对低资源语言地区方言表现出偏差,但用于量化这些差异的框架仍显稀缺。我们提出一个两阶段框架,用于评估 LLM 在九种孟加拉方言中的方言偏差。第一阶段,我们采用检索增强生成 (RAG) 流水线将标准孟加拉问题翻译并标注为方言变体版本,构建 4,000 组问题。由于传统翻译质量评估指标在非标准化方言上效果不佳,我们采用 LLM 作为裁判器进行忠实度评估,该方法人类相关性验证后显著优于传统指标。第二阶段,我们在这些 gold 标注的问题集上对 19 个 LLM 进行基准测试,执行 68,395 次 RLAIF 评估,通过多裁判一致性和人类 fallback 验证其有效性。我们的发现揭示了与语言差异相关的严重性能下降。例如,对高度差异的 Chittagong 方言的响应得分仅为 5.44/10,而 Tangail 方言得分为 7.68/10。此外,模型规模并不总能有效缓解这种偏差。我们贡献了一个经过验证的翻译质量评估方法、一套严谨的基准数据集,以及用于安全关键应用的 Critical Bias Sensitivity (CBS) 指标。
引用
@article{arxiv.2603.21359,
title = {Benchmarking Bengali Dialectal Bias: A Multi-Stage Framework Integrating RAG-Based Translation and Human-Augmented RLAIF},
author = {K. M. Jubair Sami and Dipto Sumit and Ariyan Hossain and Farig Sadeque},
journal= {arXiv preprint arXiv:2603.21359},
year = {2026}
}
备注
12 pages, 1 figure, 5 tables