利用大语言模型和检索增强生成提升低资源少数语言翻译中的文化细微差别
计算与语言
2025-05-19 v1 人工智能
摘要
本研究探讨了通过集成大语言模型(LLM)和检索增强生成(RAG)来解决低资源语言翻译挑战的方案。对 various model configurations进行了在客家语翻译上的测试,BLEU分数范围为12%(仅使用词典)至31%(使用Gemini 2.0的RAG)。性能最佳的模型(Model 4)结合了检索和先进的语言建模,提高了词汇覆盖率,尤其是针对专用或具有文化细微差别的术语,并增强了语法连贯性。采用双阶段方法(Model 3)的词典输出经Gemini 2.0精炼后 achieved a BLEU score of 26%,突显了迭代纠正的价值以及特定领域表达的挑战。静态词典方法在处理具有上下文敏感性的内容时表现不足,显示了仅依赖预定义资源的局限性。这些结果强调了需要精心策划的资源、领域知识以及与当地社区的伦理合作的重要性,提供了一种提升翻译准确性和流畅性同时支持文化保存的框架。
引用
@article{arxiv.2505.10829,
title = {Enhancing Low-Resource Minority Language Translation with LLMs and Retrieval-Augmented Generation for Cultural Nuances},
author = {Chen-Chi Chang and Chong-Fu Li and Chu-Hsuan Lee and Hung-Shin Lee},
journal= {arXiv preprint arXiv:2505.10829},
year = {2025}
}
备注
Accepted to IntelliSys 2025