CoralVQA:用于珊瑚礁图像理解的大规模视觉问答数据集
计算机视觉与模式识别
2025-11-04 v2 人工智能
摘要
珊瑚礁是至关重要且脆弱的生态系统,需要持续监测以支持保护。虽然珊瑚礁图像为珊瑚监测提供了必需信息,但解读此类图像仍具有挑战,因为需要专业知识。受大型视觉语言模型 (LVLMs) 支持的视觉问答 (VQA) 在与珊瑚礁图像进行用户友好交互方面具有巨大潜力。然而,将 VQA 应用于珊瑚影像需要一个专门的数据集,以解决两个关键挑战:领域特定标注和多维度问题。本文介绍 CoralVQA,首个面向珊瑚礁分析的大规模 VQA 数据集。它包含 12,805 张来自 67 种珊瑚属、来自 3 大洋的真实珊瑚图像,以及 277,653 对问答对,全面评估生态和健康相关条件。为构建此数据集,我们开发了一个与海洋生物学家合作的半自动数据构建管道,确保可扩展性和专业级数据质量。CoralVQA 提出了新挑战,为珊瑚礁图像上的视觉语言推理提供了全面基准。通过评估多种最新 LVLMs,我们揭示了其关键局限性与机遇。这些见解为未来 LVLM 开发奠定了基础,特别强调支持珊瑚保护的重要性。
引用
@article{arxiv.2507.10449,
title = {CoralVQA: A Large-Scale Visual Question Answering Dataset for Coral Reef Image Understanding},
author = {Hongyong Han and Wei Wang and Gaowei Zhang and Mingjie Li and Yi Wang},
journal= {arXiv preprint arXiv:2507.10449},
year = {2025}
}