中文

BioVITA:面向视觉-文本-声学对齐的生物学数据集、模型与基准

计算机视觉与模式识别 2026-03-26 v1

摘要

从多模态数据中理解动物种类正处于计算机视觉与生态学交叉的新兴挑战。虽然近期生物学模型如BioCLIP已在图像和文本生物学信息之间实现了强大的对齐,以实现种类识别,但声学模态的集成仍是未开放的问题。我们提出BioVITA——一个面向生物学应用的视觉-文本-声学对齐框架。BioVITA涉及(i)训练数据集,(ii)表示模型,(iii)检索基准。首先,我们构建了一个大规模训练数据集,包含130万个音频片段和230万张图片,覆盖14133个物种,标注了34个生态特征标签。其次,基于BioCLIP2,我们引入两个阶段的训练框架,以有效对齐音频表示与视觉和文本表示。第三,我们开发了一个跨模态检索基准,覆盖三种模态的所有可能检索方向(即图像到音频、音频到文本、文本到图像及其逆向方向),并涵盖三个生物分类学层次:科、属、种。广泛的实验表明,我们的模型学习了一个统一的表示空间,捕捉种类水平语义,超越了分类学,推动了多模态生物多样性理解。项目页面地址:https://dahlian00.github.io/BioVITA_Page/。

关键词

引用

@article{arxiv.2603.23883,
  title  = {BioVITA: Biological Dataset, Model, and Benchmark for Visual-Textual-Acoustic Alignment},
  author = {Risa Shinoda and Kaede Shiohara and Nakamasa Inoue and Kuniaki Saito and Hiroaki Santo and Fumio Okura},
  journal= {arXiv preprint arXiv:2603.23883},
  year   = {2026}
}

备注

CVPR 2026 Main