中文

技术写作反馈质量的比较研究:评估计算机科学主题中的 LLMs、SLMs 与人类

人机交互 2026-01-21 v1 人工智能 计算机与社会

摘要

反馈是学习过程的关键组成部分,尤其是在计算机科学教育中。本研究调查了大型语言模型(LLMs)、小型语言模型(SLMs)与人类反馈在三门包含技术写作内容的计算机科学课程中的质量:一门计算机科学导论课程(CS2)、一门三年级高级系统课程(操作系统)以及一门三年级写作课程(关于人工智能的主题课程)。采用将定量李克特量表问题与定性评论相结合的混合方法,我们分析了学生对反馈质量的看法,评估标准包括可读性、细节、具体性、可操作性、有用性和整体质量。分析表明,在规模较大的高年级操作系统课程(N=80N=80)中,SLMs 和 LLMs 被认为能提供清晰、可操作且结构良好的反馈,而人类则提供更具上下文细微差别的指导。至于高选课率的 CS2 课程(N=176N=176),也表现出对 AI 工具清晰度和广度的相同偏好,但学生指出 AI 反馈有时缺乏人类所提供的简洁、直击要点的指导。相反,在规模较小的高年级 AI 主题技术写作课程(N=7N=7)中,所有学生都更喜欢课程讲师的反馈,因为讲师能够提供清晰、具体和个性化的反馈,而基于 AI 的反馈则更为笼统且针对性较弱。我们还通过关注其在大规模应用中的有效性,强调了基于 AI 的反馈的可扩展性。我们的发现强调了混合方法的潜力,即将 AI 与人类反馈相结合,以实现大规模的高效和高质量反馈。

关键词

引用

@article{arxiv.2601.11541,
  title  = {A Comparative Study of Technical Writing Feedback Quality: Evaluating LLMs, SLMs, and Humans in Computer Science Topics},
  author = {Suqing Liu and Bogdan Simion and Christopher Eaton and Michael Liut},
  journal= {arXiv preprint arXiv:2601.11541},
  year   = {2026}
}