中文

超越文本:探究 K-12 教育者关于利用多模态大语言模型获取学习机会的视角与想象

人机交互 2026-03-26 v2

摘要

多模态大语言模型 (Multimodal Large Language Models, MLLMs) 正逐渐赋能新的用户体验,能够灵活地通过图像、文本、语音和视频等多种输入形式生成内容。这些能力有望丰富学习体验,使用户能够以多种模态捕捉和交互信息,但关于教育者如何构想 MLLMs 将如何塑造未来学习体验、在解释这些模型工作原理时不同教师面临的挑战,以及在教育背景下应考虑的实际需求等问题,目前了解甚少。我们通过对 12 名 K-12 教育者举办的形式化工作坊进行调查,了解教育者的视角。在工作坊中,参与者头脑风暴学习机会、讨论有效使用的实际关切,并使用 Claude 3.5 及其 Artifacts 功能原型化开发自己的 MLLM 驱动学习应用。我们采用案例研究方法,展示两种截然不同的用户方法(教师驱动与学生驱动),并分享我们所捕获的参与者表达的机会与关切,随后提出针对未来学习体验利用 MLLMs 的启示。

关键词

引用

@article{arxiv.2507.20720,
  title  = {Beyond Text: Probing K-12 Educators' Perspectives and Ideas for Learning Opportunities Leveraging Multimodal Large Language Models},
  author = {Tiffany Tseng and Katelyn Lam and Tiffany Lin Fu and Alekhya Maram},
  journal= {arXiv preprint arXiv:2507.20720},
  year   = {2026}
}