中文

面向科学中心的前沿大语言模型 Q&A 适用性研究

人工智能 2024-12-09 v1

摘要

本文探讨了前沿大型语言模型 (LLM) 在科学中心 Q&A 交互中的适用性,旨在提升访客参与度同时保持事实准确性。我们使用来自英国里斯特国家太空中心收集的问答数据集,对来自三家领先模型(OpenAI 的 GPT-4、Claude 3.5 Sonnet 和 Google Gemini 1.5)生成的响应进行评估。每个模型都被要求生成针对8岁左右受众的常规和创意响应,这些响应由太空科学专家根据准确性、参与度、清晰度、新颖性和偏离预期答案的程度进行评估。结果显示,创意性与准确性之间存在权衡,Claude 在保持清晰度和吸引年轻受众方面均优于 GPT 和 Gemini,即使被要求生成更具创意的响应。尽管如此,专家仍注意到,所有模型中更高的新颖性通常与降低的事实可靠性相关联。这一研究突显了大型语言模型在教育场景中的潜力,强调了在平衡参与度与科学严谨性方面对提示工程的必要性。

关键词

引用

@article{arxiv.2412.05200,
  title  = {Are Frontier Large Language Models Suitable for Q&A in Science Centres?},
  author = {Jacob Watson and Fabrício Góes and Marco Volpe and Talles Medeiros},
  journal= {arXiv preprint arXiv:2412.05200},
  year   = {2024}
}

备注

19 pages, 2 figures, 10 tables