中文

多模态和对话式 AI 对学习结果与体验的影响

人机交互 2026-04-03 v1 人工智能

摘要

多模态大语言模型(MLLMs)为通过以教育内容为基础的对话系统支持多媒体学习提供了可能。然而,尽管对话式 AI 已知能提升参与度,但其在视觉丰富的 STEM 领域中的学习影响仍未充分探讨。此外,如何理解多模态性与对话性在生成式 AI 系统中联合影响学习的机制亦缺乏研究。本文报告了一项随机对照在线研究(N=124)的发现,比较了三种从教科书内容学习的不同方法:(1)基于文档的对话式 AI,采用交替文本与图像响应(MuDoC);(2)基于文档的对话式 AI,仅采用文本响应(TexDoC);(3)具备语义搜索与高亮显示的教科书界面(DocSearch)。使用 MuDoC 的学习者获得了最高的后测得分,并报告了最正面的学习体验。值得注意的是,尽管 TexDoC 在参与度和易用性方面均显著优于 DocSearch,但其后测得分最低,这揭示了学生感知与学习结果之间的脱节。从认知负荷理论的视角来看,这些发现表明,对话性降低了额外认知负荷,而多模态的视觉-文字整合则增加了 germane 认知负荷,从而导致更好的学习效果。当对话性未搭配多模态性时,减少的认知努力可能仅提升感知上的理解,而非实际学习效果。

关键词

引用

@article{arxiv.2604.02221,
  title  = {Impact of Multimodal and Conversational AI on Learning Outcomes and Experience},
  author = {Karan Taneja and Anjali Singh and Ashok K. Goel},
  journal= {arXiv preprint arXiv:2604.02221},
  year   = {2026}
}

备注

16 pages, 3 figures, Accepted to AIED 2026 (Seoul, South Korea)