中文

以科学名称为提示实现零样本物种识别

计算机视觉与模式识别 2023-10-17 v1 计算与语言

摘要

在网页规模的图文对上训练得到的视觉-语言模型(VLM,如 CLIP)能够以零样本方式识别常见物体图像。然而,如何利用 CLIP 对高度专门的概念(例如鸟类、植物和动物的物种,其科学名称以拉丁文或希腊文书写)进行零样本识别,尚待充分探索。事实上,CLIP 在使用含科学名称的提示(如“a photo of Lepus Timidus”,其为拉丁文科学名)进行零样本物种识别时表现不佳,因为这些名称通常未包含在 CLIP 的训练集中。为提升性能,已有工作提出使用大语言模型(LLM)生成描述(如物种颜色与形状)并额外用于提示,我们发现其仅带来微小增益。与之不同,我们受启发将科学名称(如 Lepus Timidus)翻译为通用英文名称(如 mountain hare)并用于提示。我们发现通用名称更可能被纳入 CLIP 的训练集,以其为提示在细粒度物种识别基准数据集上取得了 2\sim5 倍的准确率提升。

关键词

引用

@article{arxiv.2310.09929,
  title  = {Prompting Scientific Names for Zero-Shot Species Recognition},
  author = {Shubham Parashar and Zhiqiu Lin and Yanan Li and Shu Kong},
  journal= {arXiv preprint arXiv:2310.09929},
  year   = {2023}
}

备注

EMNLP 2023