中文

面向层次化视觉识别的大型多模态模型的分类学感知表示对齐

计算机视觉与模式识别 2026-03-24 v2 人工智能

摘要

高性能的通用视觉理解模型应将视觉输入映射到标签的分类学树中,识别训练集之外的新型类别(这些类别可能没有可用的公开图像)。大型多模态模型(LMM)在已知类别的细粒度视觉识别(FGVR)方面取得了显著进展,但在层次化视觉识别(HVR)方面仍受限,后者旨在从粗到细预测一致的标签路径,尤其是针对新类别。为解决这些挑战,我们提出了分类学感知表示对齐(Taxonomy-Aware Representation Alignment, TARA),一种简单而有效的策略,将分类学知识注入LMM。TARA利用生物学基础模型(BFM)的表示,这些模型通过层次对比学习编码丰富的生物学关系。通过对齐视觉特征的中间表示与BFM的中间表示,LMM被鼓励提取结构化在分类学树中的判别性视觉线索。此外,我们还对第一个答案标记的表示与真实标签进行对齐,灵活地在上下文感知的视觉特征与不同粒度的类别之间建立桥梁。实验表明,TARA在提升LMM的层次一致性和叶节点准确率方面 consistently 有效,使其能够在复杂的生物学分类学中可靠地识别已知和新类别。代码已公开:https://github.com/PKU-ICST-MIPL/TARA_CVPR2026。

关键词

引用

@article{arxiv.2603.00431,
  title  = {Taxonomy-Aware Representation Alignment for Hierarchical Visual Recognition with Large Multimodal Models},
  author = {Hulingxiao He and Zhi Tan and Yuxin Peng},
  journal= {arXiv preprint arXiv:2603.00431},
  year   = {2026}
}

备注

Published as a conference paper at CVPR 2026