中文

基于 LLM 的班巴达方言标准语机器翻译检索增强生成技术比较分析

计算与语言 2025-12-17 v1 人工智能 信息检索

摘要

从标准语言翻译到其地区方言是 NLP 中的一个重要挑战,由于数据稀缺和语言变异,班巴达语的这一问题尤为突出。本文提出并比较了两种新颖的检索增强生成(RAG)管线用于标准语到方言的班巴达翻译。第一种管线使用来自音频转录的大型方言句子上下文;第二种管线则利用结构化的 local_dialect:standard_bengali 句子对。我们在六种班巴达方言和多个大语言模型上进行评估,使用 BLEU、ChrF、WER 和 BERTScore。我们的发现表明,句子对管线在所有方言上都一致优于转录管线,将 Chittagong 方言的词错误率(WER)从 76% 降至 55%。关键的是,这种 RAG 方法使较小的模型(如 Llama-3.1-8B)能够超越更大的模型(如 GPT-OSS-120B),表明良好的检索策略比模型规模更为关键。本工作为低资源方言翻译提供了一个有效且无需微调的解决方案,为保存语言多样性提供了实用的蓝图。

关键词

引用

@article{arxiv.2512.14179,
  title  = {A Comparative Analysis of Retrieval-Augmented Generation Techniques for Bengali Standard-to-Dialect Machine Translation Using LLMs},
  author = {K. M. Jubair Sami and Dipto Sumit and Ariyan Hossain and Farig Sadeque},
  journal= {arXiv preprint arXiv:2512.14179},
  year   = {2025}
}

备注

Accepted to the Second Workshop on Bangla Language Processing (BLP) at IJCNLP-AACL 2025. 14 pages, 9 figures, 6 tables