Q-Mirror:解锁科学文本-only QA 对的多模态潜力
计算与语言
2025-10-01 v2 人工智能
摘要
高质量的多模态基准测试对于推动大模型的科学推理至关重要, yet 其手动创建成本高昂且难以扩张。为解决这一瓶颈,我们探索了将文本-only QA 对 (TQA) 转换为高质量多模态 QA 对 (MMQA) 的潜力,这些对包含三个部分:1)任务定义与评估规范:我们发展了 TQA 到 MMQA 框架,建立了全面的多维度 MMQA 质量规范,为转换提供原则。2)基准构建:随后我们构建了两个广泛的基准,严格评估最先进的生成与理解模型在 MMQA 生成与 MMQA 质量评估两个不同任务上的表现。3)初步解决方案:我们开发了一个智能体系统 (Q-Mirror),通过将 MMQA 生成与评估集成到闭环中实现迭代细化。我们的实验表明,虽然最先进的模型可以生成 MMQA,但其输出仍存在显著差距,凸显了可靠评估的必要性。我们进一步展示了顶级理解模型在 MMQA 质量评估中与人类判断高度一致。基于这两项洞见,Q-Mirror 智能体将平均得分从 78.90 提升至 85.22,通过率从 72% 提升至 95%,为大规模科学基准测试提供了实际可行的路径。
引用
@article{arxiv.2509.24297,
title = {Q-Mirror: Unlocking the Multi-Modal Potential of Scientific Text-Only QA Pairs},
author = {Junying Wang and Zicheng Zhang and Ye Shen and Yalun Wu and Yingji Liang and Yijin Guo and Farong Wen and Wenzhe Li and Xuezhi Zhao and Qi Jia and Guangtao Zhai},
journal= {arXiv preprint arXiv:2509.24297},
year = {2025}
}
备注
25 pages