ChatSR:面向科学公式发现的多模态大语言模型
人工智能
2026-05-14 v3 计算与语言
摘要
当前的多模态大语言模型 (MLLM) 主要专注于感知模态(如图像和视频)的理解与处理,而其针对科学数据的理解能力仍不足。为此,我们提出了 ChatSR,这是一个专为科学数据理解而设计的新型多模态大语言模型。ChatSR 将科学数据视为一种类似于视觉内容的新模态,through carefully designed 编码器和模态对齐机制,将科学数据映射到可以被大语言模型处理的表示空间,从而使模型能够把握科学数据的结构特征和内在规律。基于这一基础,ChatSR 进一步利用大语言模型的丰富领域知识和强大推理能力,模拟一个有经验的科学家:根据用户指定的先验约束和偏好(例如对周期性、对称性等的要求),自动生成符合观察数据且符合领域先验的数学公式,从而刻画科学数据中所蕴含的潜在规律,推动科学发现的自动化。实验在 13 个数据集上表明,ChatSR 在传统符号回归基准任务中取得了最先进的性能。此外,ChatSR 还展现出对训练数据中未出现的先验知识类型展现出有前景的零样例理解和利用能力。
引用
@article{arxiv.2406.05410,
title = {ChatSR: Multimodal Large Language Models for Scientific Formula Discovery},
author = {Yanjie Li and Lina Yu and Weijun Li and Min Wu and Liping Zhang and Jingyi Liu and Yusong Deng and Mingzhu Wan and Xin Ning},
journal= {arXiv preprint arXiv:2406.05410},
year = {2026}
}
备注
14 pages,