中文

LLM能取代Neil deGrasse Tyson吗?评估LLM作为科学传播者的可靠性

计算与语言 2024-09-24 v1 人工智能

摘要

大型语言模型及由这些模型驱动的AI助手在专家和业余用户中的使用量正呈指数级增长。在本工作中,我们重点关注评估当前LLM作为科学传播者的可靠性。与现有基准不同,我们的方法强调在需要对可答性有细致理解和认识的科学问答任务上评估这些模型。我们引入了一个新颖的数据集SCiPS-QA,包含742个嵌入复杂科学概念中的是非查询,以及一个在多种标准下评估LLM正确性和一致性的基准套件。我们对来自OpenAI GPT系列的三个专有LLM和来自Meta Llama-2、Llama-3及Mistral系列的13个开源LLM进行了基准测试。尽管大多数开源模型的表现显著逊于GPT-4 Turbo,我们的实验发现Llama-3-70B是一个强有力的竞争者,在多个评估方面经常超越GPT-4 Turbo。我们还发现,即使是GPT模型在可靠验证LLM回复方面也表现出普遍的能力不足。此外,我们观察到一个令人担忧的趋势,即人类评估者会被GPT-4 Turbo的错误回复所欺骗。

关键词

引用

@article{arxiv.2409.14037,
  title  = {Can LLMs replace Neil deGrasse Tyson? Evaluating the Reliability of LLMs as Science Communicators},
  author = {Prasoon Bajpai and Niladri Chatterjee and Subhabrata Dutta and Tanmoy Chakraborty},
  journal= {arXiv preprint arXiv:2409.14037},
  year   = {2024}
}