SCITUNE:以大语言模型与人类策划的科学多模态指令相对齐
计算机视觉与模式识别
2026-04-14 v2 人工智能
计算与语言
机器学习
摘要
指令微调是一种将大语言模型(LLM)与人类意图对齐的流行范式。尽管流行,这一思路在改进 LLM 以将现有基础模型与科学学科、概念和目相对齐方面较少被探索。在本工作中,我们提出 \textit{SciTune} 作为一种微调框架,以提升 LLM 遵循由科学出版物生成的多模态指令的能力。为验证我们的方法,我们训练了一个大型多模态模型 LLaMA-SciTune,其连接视觉编码器与 LLM 以进行聚焦科学的视觉与语言理解。LLaMA-SciTune 在 SciCap 和 VisText 基准的生成图类型与图注任务上显著优于最先进(state-of-the-art)模型。与仅用合成数据微调的模型相比,LLaMA-SciTune 在 ScienceQA 基准上平均及多个子类别上超越人类表现。我们的结果表明,尽管人类生成的科学多模态指令在体量上较小且相对稀缺,相较于合成数据,其在微调 LLM 以良好完成科学任务方面仍极具价值。我们公开了 SciTune 代码库 https://github.com/pnnl/scitune。
引用
@article{arxiv.2307.01139,
title = {SCITUNE: Aligning Large Language Models with Human-Curated Scientific Multimodal Instructions},
author = {Sameera Horawalavithana and Sai Munikoti and Ian Stewart and Henry Kvinge and Karl Pazdernik},
journal= {arXiv preprint arXiv:2307.01139},
year = {2026}
}
备注
In Proceedings of the 1st Workshop on NLP for Science, Association for Computational Linguistics