中文

VisText-Mosquito:用于视觉检测、分割与文本解释的统一多模态数据集

计算机视觉与模式识别 2026-04-14 v3 计算与语言

摘要

蚊媒介疾病构成重大的全球健康风险,需通过早期检测和主动控制繁殖场所来防止疫情爆发。本文提出VisText-Mosquito,一种集成视觉与文本数据以支持自动化检测、分割和解释的多模态数据集,用于蚊子繁殖场所分析。数据集包含1828张用于对象检测的标注图像、142张用于水面分割的图像,以及与每张图像关联的自然语言解释文本。YOLOv9s模型在对象检测方面取得最高精度0.92926和mAP@50为0.92891,而YOLOv11n-Seg在分割精度达到0.91587,mAP@50为0.79795。对于文本解释生成,我们测试了多种大型视觉语言模型(LVLMs)在零样本和少量样本设置下的表现。经微调的Mosquito-LLaMA3-8B模型取得最佳结果,最终损失为0.0028,BLEU得分54.7,BERTScore为0.91,ROUGE-L为0.85。该数据集和模型框架突出“预防为主”的主题,展示了AI如何主动应对蚊媒疾病风险。数据集和实现代码已公开于GitHub:https://github.com/adnanul-islam-jisun/VisText-Mosquito

关键词

引用

@article{arxiv.2506.14629,
  title  = {VisText-Mosquito: A Unified Multimodal Dataset for Visual Detection, Segmentation, and Textual Explanation on Mosquito Breeding Sites},
  author = {Md. Adnanul Islam and Md. Faiyaz Abdullah Sayeedi and Md. Asaduzzaman Shuvo and Shahanur Rahman Bappy and Md Asiful Islam and Swakkhar Shatabda},
  journal= {arXiv preprint arXiv:2506.14629},
  year   = {2026}
}

备注

Accepted at CVPRW 2026