探索大语言模型的极限:通过MskQA和MskCal系统评估掩码文本处理能力
计算与语言
2025-09-09 v2
摘要
本文通过严格评估大语言模型(LLM)处理掩码文本的能力,揭示了其局限性。我们引入了两个新任务:MskQA,用于衡量对RealtimeQA等掩码问答数据集的推理能力;以及MskCal,用于评估对掩码算术问题的数值推理能力。对GPT-4o和4o-mini的测试表明,尽管LLM对掩码文本表现出一定的鲁棒性,但其性能高度依赖于掩码率和语义线索。具体来说,“完全掩码”(语义线索完全缺失)与“部分揭示”(保留部分语义信息)相比,性能显著下降,表明LLM依赖于表面语义模式。有趣的是,GPT-4o在MskCal任务中始终优于4o-mini,展现出更强的处理掩码文本数值推理的能力。这强调了语义线索在LLM推理过程中的关键作用。我们的研究揭示了掩码文本处理中背景知识与推理能力之间的相互作用,为更深入地理解LLM的能力和局限性铺平了道路,并强调了需要更稳健的评估方法来准确评估其真实理解能力。
引用
@article{arxiv.2411.05665,
title = {Exploring the Limits of Large Language Models: A Systematic Evaluation of Masked Text Processing Ability through MskQA and MskCal},
author = {Fuka Matsuzaki and Haru-Tada Sato},
journal= {arXiv preprint arXiv:2411.05665},
year = {2025}
}
备注
19 pages