中文

基于上下文感知提示的低资源方言翻译 LLM:以赛利赫提方言为例

计算与语言 2025-12-01 v1 计算机与社会

摘要

大语言模型(LLM)通过提示展示出强大的翻译能力,尽管无需任务特定训练。然而,这些模型在方言和低资源情境中的有效性尚未得到充分探索。本研究提出首个系统性调查 LLM 基于机器翻译(MT)的方言翻译方法,针对本身低资源的赛利赫提方言(Sylheti)。我们评估了五个高级 LLM(GPT-4.1、GPT-4.1、LLaMA 4、Grok 3 和 DeepSeek V3.2)在双向翻译(Bangla \Leftrightarrow Sylheti)中的表现,发现这些模型在方言特定词汇方面存在挑战。为此,我们引入赛利赫提-CAP(Context-Aware Prompting),一个嵌入语言规则手册、词典(2,260 个核心词汇项和习语)以及身份验证检查的三步骤框架。广泛实验表明,赛利赫提-CAP 在所有模型和提示策略上均一致改善了翻译质量。自动指标和人类评估均确认其有效性,而定性分析则揭示了显著减少幻觉、模糊和生硬措辞的效果,确立了赛利赫提-CAP 作为方言和低资源 MT 可扩展解决方案的地位。数据集链接: \href{https://github.com/TabiaTanzin/LLMs-for-Low-Resource-Dialect-Translation-Using-Context-Aware-Prompting-A-Case-Study-on-Sylheti.git}{https://github.com/TabiaTanzin/LLMs-for-Low-Resource-Dialect-Translation-Using-Context-Aware-Prompting-A-Case-Study-on-Sylheti.git}

关键词

引用

@article{arxiv.2511.21761,
  title  = {LLMs for Low-Resource Dialect Translation Using Context-Aware Prompting: A Case Study on Sylheti},
  author = {Tabia Tanzin Prama and Christopher M. Danforth and Peter Sheridan Dodds},
  journal= {arXiv preprint arXiv:2511.21761},
  year   = {2025}
}