大型语言模型的零样本常识验证与推理:在 SemEval-2020 Task 4 数据集上的评估
计算与语言
2025-02-25 v1 人工智能
摘要
本研究评估了大型语言模型(LLMs)在 SemEval-2020 Task 4 数据集上的表现,聚焦于常识验证与解释。我们的 methodology involves evaluating multiple LLMs,包括 LLaMA3-70B、Gemma2-9B 和 Mixtral-8x7B,使用零样本提示技术。模型在两个任务上进行测试:任务 A(常识验证),其中模型判断陈述是否符合常识知识;任务 B(常识解释),其中模型识别不合理陈述的推理依据。基于准确率对结果进行评估,并与微调的基于变换器模型进行比较。结果表明,更大规模的模型优于以前的模型,在任务 A 上表现接近人类评估,其中 LLaMA3-70B 在任务 A 中取得了最高的 98.40% 的准确率,而在任务 B 中滞后于以前模型,准确率为 93.40%。然而,尽管模型有效识别不合理陈述,但在选择最相关的解释方面面临挑战,这凸显了在因果推理和推理方面的局限性。
引用
@article{arxiv.2502.15810,
title = {Zero-Shot Commonsense Validation and Reasoning with Large Language Models: An Evaluation on SemEval-2020 Task 4 Dataset},
author = {Rawand Alfugaha and Mohammad AL-Smadi},
journal= {arXiv preprint arXiv:2502.15810},
year = {2025}
}