基于 LLM 的班巴达方言标准语机器翻译检索增强生成技术比较分析
计算与语言
2025-12-17 v1 人工智能
信息检索
摘要
从标准语言翻译到其地区方言是 NLP 中的一个重要挑战,由于数据稀缺和语言变异,班巴达语的这一问题尤为突出。本文提出并比较了两种新颖的检索增强生成(RAG)管线用于标准语到方言的班巴达翻译。第一种管线使用来自音频转录的大型方言句子上下文;第二种管线则利用结构化的 local_dialect:standard_bengali 句子对。我们在六种班巴达方言和多个大语言模型上进行评估,使用 BLEU、ChrF、WER 和 BERTScore。我们的发现表明,句子对管线在所有方言上都一致优于转录管线,将 Chittagong 方言的词错误率(WER)从 76% 降至 55%。关键的是,这种 RAG 方法使较小的模型(如 Llama-3.1-8B)能够超越更大的模型(如 GPT-OSS-120B),表明良好的检索策略比模型规模更为关键。本工作为低资源方言翻译提供了一个有效且无需微调的解决方案,为保存语言多样性提供了实用的蓝图。
引用
@article{arxiv.2512.14179,
title = {A Comparative Analysis of Retrieval-Augmented Generation Techniques for Bengali Standard-to-Dialect Machine Translation Using LLMs},
author = {K. M. Jubair Sami and Dipto Sumit and Ariyan Hossain and Farig Sadeque},
journal= {arXiv preprint arXiv:2512.14179},
year = {2025}
}
备注
Accepted to the Second Workshop on Bangla Language Processing (BLP) at IJCNLP-AACL 2025. 14 pages, 9 figures, 6 tables