技术写作反馈质量的比较研究:评估计算机科学主题中的 LLMs、SLMs 与人类
人机交互
2026-01-21 v1 人工智能
计算机与社会
摘要
反馈是学习过程的关键组成部分,尤其是在计算机科学教育中。本研究调查了大型语言模型(LLMs)、小型语言模型(SLMs)与人类反馈在三门包含技术写作内容的计算机科学课程中的质量:一门计算机科学导论课程(CS2)、一门三年级高级系统课程(操作系统)以及一门三年级写作课程(关于人工智能的主题课程)。采用将定量李克特量表问题与定性评论相结合的混合方法,我们分析了学生对反馈质量的看法,评估标准包括可读性、细节、具体性、可操作性、有用性和整体质量。分析表明,在规模较大的高年级操作系统课程()中,SLMs 和 LLMs 被认为能提供清晰、可操作且结构良好的反馈,而人类则提供更具上下文细微差别的指导。至于高选课率的 CS2 课程(),也表现出对 AI 工具清晰度和广度的相同偏好,但学生指出 AI 反馈有时缺乏人类所提供的简洁、直击要点的指导。相反,在规模较小的高年级 AI 主题技术写作课程()中,所有学生都更喜欢课程讲师的反馈,因为讲师能够提供清晰、具体和个性化的反馈,而基于 AI 的反馈则更为笼统且针对性较弱。我们还通过关注其在大规模应用中的有效性,强调了基于 AI 的反馈的可扩展性。我们的发现强调了混合方法的潜力,即将 AI 与人类反馈相结合,以实现大规模的高效和高质量反馈。
引用
@article{arxiv.2601.11541,
title = {A Comparative Study of Technical Writing Feedback Quality: Evaluating LLMs, SLMs, and Humans in Computer Science Topics},
author = {Suqing Liu and Bogdan Simion and Christopher Eaton and Michael Liut},
journal= {arXiv preprint arXiv:2601.11541},
year = {2026}
}