中文

大型多模态模型(是否)在视觉物种识别中大放异彼?

机器学习 2025-12-19 v1 计算机视觉与模式识别

摘要

视觉物种识别 (VSR) 是生物多样性评估与保护、演化研究以及生态与生态系统管理的关键环节。训练用于 VSR 的机器学习模型通常需要大量标注图像。然而,物种级别的标注需要专业知识,这使得专业人员只能标注少量示例。这些有限的标记数据激励通过少样本学习 (FSL) 训练“专家”模型。与此同时,先进的大型多模态模型 (LMM) 已在通用识别任务上展示出显著性能。因此,一个显而易见的问题是 LMM 在这一高度专业化的 VSR 任务中是否出类拔萃,是否凌驾于 FSL 专家模型。令人惊讶的是,我们发现 LMM 在该任务上困难重重,尽管使用了各种已建立的提示技术。LMM 甚至显著低于 FSL 专家模型,这些模型与在少样本图像上进行预训练视觉编码器微调一样简单。然而,我们的深入分析揭示,LMM 可以有效地后事后纠正专家模型的错误预测。简而言之,给定测试图像,针对 FSL 专家模型的前景预测进行提示,LMM 可恢复真实标签。基于此洞见,我们派生出一种称为后事后纠正 (POC) 的简单方法,该方法提示 LMM 使用包含 softmax 置信度分数和少样本视觉示例的丰富提示重新排序专家模型的前景预测。在五个具有挑战性的 VSR 基准测试中,POC 在准确率上超过先前的 FSL 方法提升 +6.4%,且无需额外训练、验证或人工干预。重要的是,POC 适用于不同预训练主干模型和 LMM,作为一种即插即用的模块显著增强现有 FSL 方法。

关键词

引用

@article{arxiv.2512.15748,
  title  = {Surely Large Multimodal Models (Don't) Excel in Visual Species Recognition?},
  author = {Tian Liu and Anwesha Basu and James Caverlee and Shu Kong},
  journal= {arXiv preprint arXiv:2512.15748},
  year   = {2025}
}

备注

website and code: https://tian1327.github.io/POC