DeepSeek-R1 与 o3-mini:如何评估推理型大语言模型在机器翻译和摘要生成中的表现
计算与语言
2025-06-02 v3
摘要
具有推理能力的大型语言模型(LLM)在逻辑任务中表现突出,但其在自然语言生成评估中的实用性尚未探索。本研究系统比较了推理型 LLM 与非推理型 LLM 在机器翻译和文本摘要评估任务中的表现。我们评估了八个模型,涵盖最先进的推理模型(DeepSeek-R1、OpenAI o3)、其蒸馏变体(8B-70B 参数)以及等效非推理 LLM。在 WMT23 和 SummEval 基准测试中实验结果显示,架构和任务都具有依赖性优势:OpenAI o3-mini 模型在机器翻译中表现出随推理程度提升的改进,而 DeepSeek-R1 总体上不如其非推理变体,除非在摘要一致性评估中。相关性分析表明,推理 token 使用量仅在特定模型中与评估质量相关,而大多数模型普遍在识别更多质量问题时会分配更多推理 token。蒸馏在 32B 参数模型中保持合理性能,但在 8B 规模时显著下降。本工作提供了推理 LLM 用于 NLG 评估的首次评估,并与非推理模型进行比较。我们分享代码以便进一步研究:https://github.com/NL2G/reasoning-eval。
关键词
引用
@article{arxiv.2504.08120,
title = {DeepSeek-R1 vs. o3-mini: How Well can Reasoning LLMs Evaluate MT and Summarization?},
author = {Daniil Larionov and Sotaro Takeshita and Ran Zhang and Yanran Chen and Christoph Leiter and Zhipin Wang and Christian Greisinger and Steffen Eger},
journal= {arXiv preprint arXiv:2504.08120},
year = {2025}
}