测试LLM在基于LSP翻译错误类型学注释翻译方面的能力:以ChatGPT为例的首次实验
计算与语言
2025-04-22 v1 音频与语音处理
摘要
本研究探讨了大型语言模型(LLMs), Specifically ChatGPT,在基于特定领域翻译错误类型学注释MT输出方面的能力。与之前关注通用语言的工作不同,我们探索ChatGPT识别和分类特定翻译中错误的能力。通过测试两种不同的提示,并基于定制的错误类型学,我们将ChatGPT注释与DeepL和ChatGPT自身产生的翻译的人类专家评估进行比较。结果显示,针对DeepL生成的翻译,召回率和精确率相当较高。然而,错误分类的准确度取决于提示的具体特征及其详细程度,ChatGPT在详细提示下表现良好。当评估其自身翻译时,ChatGPT获得的成绩显著较差,揭示了自我评估的局限性。这些结果凸显了LLM在特定领域翻译评估方面的潜力与局限性。我们的实验为未来研究开辟了道路,尤其是针对开源LLM,可能产生与或更高质量的注释。我们也计划在翻译训练的实际效果情境下测试自动化评估的有效性,特别是通过优化教师进行人类评估的过程,并探讨LLM注释对学生后期编辑和翻译学习的影响。
引用
@article{arxiv.2504.15052,
title = {Testing LLMs' Capabilities in Annotating Translations Based on an Error Typology Designed for LSP Translation: First Experiments with ChatGPT},
author = {Joachim Minder and Guillaume Wisniewski and Natalie Kübler},
journal= {arXiv preprint arXiv:2504.15052},
year = {2025}
}
备注
Accepted for publication in the proceedings of MT Summit 2025