中文

TinyChemVL:通过高效视觉标记压缩与复杂反应任务提升化学视觉语言模型

计算机视觉与模式识别 2025-11-27 v2

摘要

虽然视觉语言模型(VLM)在一般视觉理解方面已显示出卓越能力,但其在化学领域的应用仍有限,此前的工作主要聚焦于文本,忽略了关键视觉信息,如分子结构。当前直接采用标准 VLM 应用于化学任务的做法面临两个主要问题:(i)处理整个化学图像及其非信息性背景的计算效率低下;(ii)仅关注分子层级任务,限制了化学推理的进展。本文提出了\textbf{TinyChemVL},一种利用视觉标记压缩和反应级任务提升模型效率与推理能力的高效且强大的化学 VLM。我们还提出了\textbf{ChemRxn-V},用于评估基于视觉的反应识别与预测任务的反应级基准。直接从分子图像预测反应产物是一个非平凡的挑战,因为它需要模型具备识别与推理能力的融合。我们的结果表明,TinyChemVL 仅需 4B 参数即可在分子与反应任务上实现卓越性能,同时在推理与训练速度上优于现有模型。值得注意的是,TinyChemVL 在仅使用 1/16 视觉标记的情况下,就已超越 ChemVLM。本工作通过协同设计模型架构与任务复杂度,为化学领域构建高效而强大的视觉语言模型。

关键词

引用

@article{arxiv.2511.06283,
  title  = {TinyChemVL: Advancing Chemical Vision-Language Models via Efficient Visual Token Reduction and Complex Reaction Tasks},
  author = {Xuanle Zhao and Shuxin Zeng and Xinyuan Cai and Xiang Cheng and Duzhen Zhang and Xiuyi Chen and Bo Xu},
  journal= {arXiv preprint arXiv:2511.06283},
  year   = {2025}
}

备注

Accepted by AAAI 2026