DeepTaxon:用于统一物种识别与发现的可解释检索增强多模态框架
计算机视觉与模式识别
2026-04-28 v1 计算与语言
信息检索
多媒体
摘要
在生物学中,在成千上万个视觉上相似的分类学单位中识别物种,同时在开放世界环境中发现未知物种,仍是物种多样性研究中的根本性挑战。当前方法将识别与发现视为独立问题,分类模型假设闭合集合,而发现依赖基于阈值的拒绝机制。在本文中,我们提出 DeepTaxon,一种检索增强的多模态框架,通过对检索到的视觉证据进行可解释推理,统一了物种识别与发现。给定查询图像,DeepTaxon 检索出 top-k 个候选物种,每个候选物种包含 n 张示例图像,并进行链式思考比较推理。关键在于,我们将发现重新定义为显式的检索决策问题,而非隐式的参数化记忆问题。当检索索引缺乏足够证据进行识别时,样本即为 novel,每个检索自然产生分类或发现标签,无需人工标注,从而为两项任务提供自动监督。我们通过在合成检索增强数据上的监督微调, followed by hard samples 上的强化学习,将高召回率的检索转化为高精度决策,扩展至大型分类学词汇表。在大型分布内基准测试和六个分布外数据集上的大量实验表明,识别与发现均实现一致提升。消融研究进一步揭示了候选数量 k 和示例数量 n 上的有效测试时扩展,强大的零样本迁移到未见域,以及跨检索编码器的稳定性能,为物种多样性研究建立了可解释解决方案。
引用
@article{arxiv.2604.24029,
title = {DeepTaxon: An Interpretable Retrieval-Augmented Multimodal Framework for Unified Species Identification and Discovery},
author = {Jiawei Wang and Ming Lei and Yaning Yang and Xinyan Lin and Yuquan Le and Qiwei Ma and Zhiwei Xu and Zheqi Lv and Yuchen Ang and Zhe Quan and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2604.24029},
year = {2026}
}
备注
13 pages, 6 figures, 9 tables