中文

评估大语言模型在中文成语翻译中的表现

计算与语言 2025-08-15 v1

摘要

成语因其隐喻意义常与字面解释不同,在日常语言中尤为常见,尤其在中文语境下常包含历史典故并遵循特定结构模式。尽管近期大型语言模型在机器翻译方面取得进展,但关于中文成语翻译的研究仍鲜为人知。本文引入 IdiomEval 框架,构建了全面的成语翻译错误分类体系。我们标注了来自九个现代系统(包括 GPT-4o 和 Google Translate)在四个领域(网页、新闻、Wikipedia 和社交媒体)上的 900 组翻译。我们发现这些系统在成语翻译方面表现不佳,产生错误、字面、部分或甚至缺失的翻译。表现最好的系统 GPT-4 在 28% 的案例中仍存在错误。我们还发现现有评估指标对成语质量评估效果不佳,与人类评分的皮尔逊相关性低于 0.48。因此,我们开发了改进模型,实现了 0.68 的 F1 分数用于检测成语翻译错误。

关键词

引用

@article{arxiv.2508.10421,
  title  = {Evaluating LLMs on Chinese Idiom Translation},
  author = {Cai Yang and Yao Dou and David Heineman and Xiaofeng Wu and Wei Xu},
  journal= {arXiv preprint arXiv:2508.10421},
  year   = {2025}
}

备注

Accepted at COLM 2025