大型多模态模型是否解决了科学图形的图注生成?从SciCap挑战2023中汲取的经验教训
计算与语言
2025-02-19 v3 人工智能
计算机视觉与模式识别
摘要
自2021年SciCap数据集发布以来,研究界在生成学术文章中科学图形的图注方面取得了显著进展。2023年,第一届SciCap挑战赛举行,邀请全球团队使用扩展的SciCap数据集开发模型,为跨多个学术领域的各种图形类型生成图注。与此同时,文本生成模型快速发展,许多强大的预训练大型多模态模型(LMM)涌现,在各种视觉与语言任务中展现出令人印象深刻的能力。本文概述了第一届SciCap挑战赛,并详细介绍了各种模型在其数据上的表现,捕捉了该领域的现状。我们发现,专业编辑压倒性地偏好GPT-4V生成的图注,而非所有其他模型甚至作者撰写的原始图注。基于这一关键发现,我们进行了详细分析以回答这个问题:先进的大型多模态模型是否已经解决了科学图形图注生成的任务?
引用
@article{arxiv.2501.19353,
title = {Do Large Multimodal Models Solve Caption Generation for Scientific Figures? Lessons Learned from SciCap Challenge 2023},
author = {Ting-Yao E. Hsu and Yi-Li Hsu and Shaurya Rohatgi and Chieh-Yang Huang and Ho Yin Sam Ng and Ryan Rossi and Sungchul Kim and Tong Yu and Lun-Wei Ku and C. Lee Giles and Ting-Hao K. Huang},
journal= {arXiv preprint arXiv:2501.19353},
year = {2025}
}
备注
Accepted to TACL 2025