中文

你的多模态大语言模型是好的科学导师吗?

计算与语言 2025-05-13 v1

摘要

多模态大语言模型 (MLLM) 在科学推理任务(如 ScienceQA)上表现突出。然而,大多数现有基准仅关注最终答案的准确性,忽略其他指标。特别是在应用于教育情境时,目标不仅是正确性,还在于教学能力。本文提出了使用全面教育评估标准和模拟学生模型来评估 MLLM 作为科学导师的框架。给定一组候选 MLLM 科学导师,我们使用基于评估标准的学生判断生成一系列导师绩效分数,识别出优秀和不佳的导师。随后,我们利用 ScienceQA 数据集的训练部分构建了强导师与弱导师输出之间的两两比较数据集。这使我们能够应用多种偏好优化方法对表现不佳的导师模型(Qwen2-VL-2B)进行微调,以提升其教学效果。我们的结果表明,强问题解决能力并不一定保证高质量的教学,性能优化导向的改进可产生更符合教育导向的导师模型。这一方法为构建不仅是问题解决者,更是真正有帮助的教育助理的 MLLM 开辟了道路。

关键词

引用

@article{arxiv.2505.06418,
  title  = {Is your multimodal large language model a good science tutor?},
  author = {Ming Liu and Liwen Wang and Wensheng Zhang},
  journal= {arXiv preprint arXiv:2505.06418},
  year   = {2025}
}