中文

我们能否通过零样本示例改进教育图表生成?如果幻觉破坏了一切,答案是否定的

计算与语言 2026-01-29 v1

摘要

生成式人工智能(AI)在计算教育领域得到了广泛应用;然而,生成材料的质量引起了教育者和学生之间的关注。本研究通过引入一种基于修辞结构理论(Rhetorical Structure Theory, RST)的零样本示例方法,旨在改进图表代码生成,以便模型的输出与用户的预期相匹配。我们通过计算机科学教育者对150个使用大语言模型(LLM)生成的图表进行评估,评估指标包括逻辑组织、连通性、布局美观性以及AI幻觉。评估数据集还被进一步调查其在自动化图表评估中的实用性。初步结果表明,我们的方法降低了事实性幻觉的发生率,提高了图表对提供上下文的忠实度;然而,由于LLM的随机性,生成图表的质量存在波动。此外,我们对AI幻觉与生成图表质量之间的关系进行了深入分析和讨论,揭示文本上下文的复杂性会导致更高的幻觉率,LLM往往无法检测到自己输出中的错误。

关键词

引用

@article{arxiv.2601.20476,
  title  = {Can We Improve Educational Diagram Generation with In-Context Examples? Not if a Hallucination Spoils the Bunch},
  author = {Evanfiya Logacheva and Arto Hellas and Tsvetomila Mihaylova and Juha Sorva and Ava Heinonen and Juho Leinonen},
  journal= {arXiv preprint arXiv:2601.20476},
  year   = {2026}
}