中文

人类- AI 交互:评估 LLM 在数字逻辑电路相关图问题上的推理能力——以创意设计与分析为评估维度

硬件体系结构 2026-02-18 v1

摘要

大型语言模型(LLM)日益被本科生用作随叫随到的辅导工具,但其在电路与图表类数字逻辑问题上的可靠性尚不明确。我们报告了一项人类-AI 研究,评估了三款广泛使用的 LLM(GPT、Gemini 和 Claude)在涵盖非标准计数器、JK 触发器状态迁移、时序图、频率分频和有限状态机等十个本科水平数字逻辑问题上的表现。二十四名学生完成了两两模型比较,给出每题关于(i)首选模型、(ii)感知正确性、(iii)一致性、(iv)冗长程度和(v)置信度的判断,并给出整体模型质量、满意度(如准确性和清晰度等多个维度)以及验证答案所需的认知 effort 的全局评分。为评估技术有效性,我们对所有十个问题应用独立评委基于评估,对照官方解答进行严格正确性标准的评估。结果显示,感知有用性与形式正确性之间存在持续的差距:对于最具序列挑战性的问题(Q1-Q7),所评估的三款 LLM 中没有一款匹配官方答案,尽管它们产生了自信、结构完整的解释,学生往往对其给予 favorable 评价。错误分析表明,模型常默认调用经典教科书模板(如标准波纹计数器),并在难以将电路结构转化为精确状态演化和时序行为方面存在困难。这一发现表明,在缺乏验证支架的情况下,LLM 可能不可靠,用于数字逻辑的核心主题,进而可能无意中强化本科生教学中的误解。

关键词

引用

@article{arxiv.2602.15336,
  title  = {Human-AI Interaction: Evaluating LLM Reasoning on Digital Logic Circuit included Graph Problems, in terms of creativity in design and analysis},
  author = {Yogeswar Reddy Thota and Setareh Rafatirad and Homayoun Houman and Tooraj Nikoubin},
  journal= {arXiv preprint arXiv:2602.15336},
  year   = {2026}
}