ChemOrch:通过合成指令赋予大语言模型化学智能
计算与语言
2025-09-23 v1
摘要
由于缺乏高质量、特定领域的指令-响应数据集,以及现有合成数据生成流程与化学信息固有的层次化和规则化结构不匹配,赋予大语言模型(LLMs)化学智能仍然是一个挑战。为了解决这个问题,我们提出了ChemOrch,这是一个通过两阶段过程合成基于化学的指令-响应对的框架:任务控制的指令生成和工具感知的响应构建。ChemOrch能够为生成的任务提供可控的多样性和难度级别,并通过工具规划和蒸馏以及基于工具的自我修复机制确保响应的精确性。ChemOrch的有效性基于以下方面进行评估:1)生成的指令数据质量高,展示了卓越的多样性并与化学约束高度对齐;2)可靠地生成评估任务,能更有效地揭示LLM在化学方面的弱点;3)当生成的指令数据用于微调时,LLM的化学能力得到显著提升。因此,我们的工作代表了朝着在LLM中实现可扩展和可验证的化学智能迈出的关键一步。
引用
@article{arxiv.2509.16543,
title = {ChemOrch: Empowering LLMs with Chemical Intelligence via Synthetic Instructions},
author = {Yue Huang and Zhengzhe Jiang and Xiaonan Luo and Kehan Guo and Haomin Zhuang and Yujun Zhou and Zhengqing Yuan and Xiaoqi Sun and Jules Schleinitz and Yanbo Wang and Shuhao Zhang and Mihir Surve and Nitesh V Chawla and Olaf Wiest and Xiangliang Zhang},
journal= {arXiv preprint arXiv:2509.16543},
year = {2025}
}