中文

评估 o1 类 LLM:通过全面分析解锁翻译推理能力

计算与语言 2025-02-18 v1

摘要

o1 类 LLM 正通过模拟人类认知过程来变革人工智能,但其在多语言机器翻译(MMT)中的表现尚未得到充分探索。本研究检验:(1)o1 类 LLM 在 MMT 任务中的表现;(22)影响翻译质量的关键因素。我们评估了多款 o1 类 LLM,并与传统模型(如 ChatGPT 和 GPT-4o)进行比较。结果表明,o1 类 LLM 在多语言翻译方面树立了新标杆,DeepSeek-R1 在无上下文任务中超越了 GPT-4o。它们在历史和文化翻译方面表现突出,但在中文中心输出中存在倾向性输出的问题。进一步分析揭示了三个关键发现:(1)高推理成本和较慢的处理速度使得复杂翻译任务更加资源密集;(2)模型规模增大可提升翻译质量,增强常识推理和文化翻译能力;(3)温度参数对输出质量影响显著——低温度产生更稳定、更准确的翻译,而高温度则降低连贯性和精确度。

关键词

引用

@article{arxiv.2502.11544,
  title  = {Evaluating o1-Like LLMs: Unlocking Reasoning for Translation through Comprehensive Analysis},
  author = {Andong Chen and Yuchen Song and Wenxin Zhu and Kehai Chen and Muyun Yang and Tiejun Zhao and Min zhang},
  journal= {arXiv preprint arXiv:2502.11544},
  year   = {2025}
}