消费者聊天机器人是否能够推理?——基于“AI-for-All”本科课程的学生主导实验
计算机与社会
2026-01-09 v1 人工智能
摘要
关于大型语言模型(LLM)聊天机器人是否“推理”的论点通常使用精选基准和实验室式评估协议进行讨论。本文提供了另一种视角:嵌入乔治亚梅森大学UNIV 182(AI4All)课程的学生主导现场实验,这是一门面向全学科本科生的课程,无需事先的STEM背景。学生团队设计自己的推理任务,在当前主流消费聊天机器人中运行并评估(i)答案的正确性(ii)推理过程的有效性(例如,答案正确但解释不当,或相反)。在八个团队报告了标准化分数后,学生贡献了80个原创推理提示,涵盖六个类别:模式完成、转换规则、空间/视觉推理、量化推理、关系/逻辑推理和类比推理。这些提示产生了320个模型响应及后续解释。聚合团队层面的结果,OpenAI GPT-5和Claude 4.5在最高的平均答案准确率(86.2%和83.8%),其后是Grok 4(82.5%)和Perplexity(73.1%);解释有效性呈类似排序(81.2%、80.0%、77.5%、66.2%)。从定性来看,团队一致发现一种错误特征:在短而结构化的数学和模式项目上表现强劲,但在空间/视觉推理和多步骤转换上可靠性下降,频繁出现“听起来正确但推理错误”的解释。该作业的主要贡献是教育性的:它将AI素养操作化为实验实践(提示设计、测量、评分者 disagreement以及可解释性/ grounding),同时产生了以真实终端用户交互为基础的可重用、学生生成的推理探针语料库。
引用
@article{arxiv.2601.04225,
title = {Can Consumer Chatbots Reason? A Student-Led Field Experiment Embedded in an "AI-for-All" Undergraduate Course},
author = {Amarda Shehu and Adonyas Ababu and Asma Akbary and Griffin Allen and Aroush Baig and Tereana Battle and Elias Beall and Christopher Byrom and Matt Dean and Kate Demarco and Ethan Douglass and Luis Granados and Layla Hantush and Andy Hay and Eleanor Hay and Caleb Jackson and Jaewon Jang and Carter Jones and Quanyang Li and Adrian Lopez and Logan Massimo and Garrett McMullin and Ariana Mendoza Maldonado and Eman Mirza and Hadiya Muddasar and Sara Nuwayhid and Brandon Pak and Ashley Petty and Dryden Rancourt and Lily Rodriguez and Corbin Rogers and Jacob Schiek and Taeseo Seok and Aarav Sethi and Giovanni Vitela and Winston Williams and Jagan Yetukuri},
journal= {arXiv preprint arXiv:2601.04225},
year = {2026}
}