LLM翻译:历史、低资源语言与当代AI模型
计算与语言
2025-03-18 v1 人工智能
摘要
大型语言模型(LLM)在无需显式训练的情况下展现出在执行各种任务(包括机器翻译)方面的显著适应性。像 OpenAI 的 GPT-4 和 Google 的 Gemini 等模型经常根据翻译基准进行评估,并被用作翻译工具,因其高性能。本论文研究了 Gemini 将 18 世纪奥斯曼土耳其手稿《异教徒的囚徒:蒂米什瓦拉的奥斯曼阿加回忆录》翻译成英文的表现。该手稿记述了奥斯曼臣民奥斯曼阿加在奥地利作为战俘度过的 11 年经历,包括他对战争与暴力的记述。我们的分析表明,Gemini 的安全机制将 14% 至 23% 的手稿标记为有害内容,导致部分段落未被翻译。这些安全设置虽然在缓解潜在危害方面有效,但阻碍了模型对历史文本提供完整且准确翻译的能力。通过真实历史案例,本研究揭示了当前 LLM 安全实现在处理敏感且内容丰富的材料时的固有挑战与局限性。这些现实案例凸显了 LLM 在当代翻译场景中的潜在失败——在这些场景中,准确且完整的翻译至关重要,例如为法律诉讼或人道主义文件翻译现代战争受害者的记述。
引用
@article{arxiv.2503.11898,
title = {LLMs for Translation: Historical, Low-Resourced Languages and Contemporary AI Models},
author = {Merve Tekgurler},
journal= {arXiv preprint arXiv:2503.11898},
year = {2025}
}
备注
Accepted to LaTeCH-CLfL 2025, held in conjunction with NAACL 2025