聊天机器人GPT与DeepSeek在关键自然语言处理任务中的比较评估:优势、劣势与领域特定性能
计算与语言
2025-08-12 v3 人工智能
摘要
大型语言模型(LLM)在自然语言处理(NLP)任务中的应用日益增长,催生了对其在不同应用场景中效果的广泛评估需求。虽然聊天机器人GPT和DeepSeek在许多NLP领域展现出强劲的表现,但仍需进行全面评估以理解其优势、劣势及特定领域的能力。这种评估至关重要,因为这些模型被应用于从情感分析到文本蕴含和翻译等多种任务。本研究旨在评估聊天机器人GPT和DeepSeek在五个关键NLP任务中的表现:情感分析、主题分类、文本摘要、机器翻译和文本蕴含。采用结构化的实验协议以确保公平性并最小化变异性。两个模型均使用相同的中性提示,在每个任务下分别测试两个基准数据集,涵盖新闻、评论和正式/非正式文本等领域。结果显示,DeepSeek在分类稳定性和逻辑推理方面表现出色,而聊天机器人GPT在需要细致理解和灵活性的任务中表现更佳。这些发现为根据任务需求选择合适的大型语言模型提供了宝贵的参考。
引用
@article{arxiv.2506.18501,
title = {Comparative Evaluation of ChatGPT and DeepSeek Across Key NLP Tasks: Strengths, Weaknesses, and Domain-Specific Performance},
author = {Wael Etaiwi and Bushra Alhijawi},
journal= {arXiv preprint arXiv:2506.18501},
year = {2025}
}