中文

基于语义特征匹配的开放词汇动物关键点检测

计算机视觉与模式识别 2024-10-03 v4

摘要

当前基于图像的人体及动物(含人类)身体与面部关键点检测方法通常分为全监督和无须指定类别的少样本方法两类。前者通常依赖费力且耗时的手动标注,在将关键点检测扩展到更广泛的关键点类别和动物物种时面临巨大挑战。后者虽较少依赖大量人工输入,在测试时仍需带标注的参考支持图像。为实现无任何先验标注的零样本关键点检测,我们引入开放词汇关键点检测(OVKD)任务,其创新性地设计为使用文本提示来识别任意物种上的任意关键点。为实现该目标,我们开发了名为基于语义特征匹配的开放词汇关键点检测(KDSM)的新框架。该框架协同结合视觉与语言模型,在语言特征与局部关键点视觉特征之间建立相互作用。KDSM 通过集成域分布矩阵匹配(DDMM)及视觉-关键点关系感知(VKRA)等其他专用模块来增强其能力,提升了框架的泛化性与整体性能。我们的综合实验表明,KDSM 在性能上显著优于基线,并在 OVKD 任务中取得显著成功。令人印象深刻的是,我们以零样本方式运行的方法,仍取得了与最先进的少样本物种无关关键点检测方法相当的结果。我们将公开源代码。

关键词

引用

@article{arxiv.2310.05056,
  title  = {Open-Vocabulary Animal Keypoint Detection with Semantic-feature Matching},
  author = {Hao Zhang and Lumin Xu and Shenqi Lai and Wenqi Shao and Nanning Zheng and Ping Luo and Yu Qiao and Kaipeng Zhang},
  journal= {arXiv preprint arXiv:2310.05056},
  year   = {2024}
}

备注

Accepted by International Journal of Computer Vision