以科学名称为提示实现零样本物种识别
计算机视觉与模式识别
2023-10-17 v1 计算与语言
摘要
在网页规模的图文对上训练得到的视觉-语言模型(VLM,如 CLIP)能够以零样本方式识别常见物体图像。然而,如何利用 CLIP 对高度专门的概念(例如鸟类、植物和动物的物种,其科学名称以拉丁文或希腊文书写)进行零样本识别,尚待充分探索。事实上,CLIP 在使用含科学名称的提示(如“a photo of Lepus Timidus”,其为拉丁文科学名)进行零样本物种识别时表现不佳,因为这些名称通常未包含在 CLIP 的训练集中。为提升性能,已有工作提出使用大语言模型(LLM)生成描述(如物种颜色与形状)并额外用于提示,我们发现其仅带来微小增益。与之不同,我们受启发将科学名称(如 Lepus Timidus)翻译为通用英文名称(如 mountain hare)并用于提示。我们发现通用名称更可能被纳入 CLIP 的训练集,以其为提示在细粒度物种识别基准数据集上取得了 25 倍的准确率提升。
引用
@article{arxiv.2310.09929,
title = {Prompting Scientific Names for Zero-Shot Species Recognition},
author = {Shubham Parashar and Zhiqiu Lin and Yanan Li and Shu Kong},
journal= {arXiv preprint arXiv:2310.09929},
year = {2023}
}
备注
EMNLP 2023