KptLLM:揭示大语言模型在关键点理解中的能力
计算机视觉与模式识别
2024-11-05 v1
摘要
多模态大语言模型(MLLM)的最新进展大大提高了其在图像理解方面的能力。然而,这些模型往往难以把握像素级的语义细节,例如物体的关键点。为了弥补这一差距,我们引入了语义关键点理解的新挑战,旨在理解不同任务场景中的关键点,包括关键点语义理解、基于视觉提示的关键点检测和基于文本提示的关键点检测。此外,我们引入了KptLLM,一个统一的多模态模型,它采用先识别后检测的策略来有效应对这些挑战。KptLLM强调对关键点语义的初步辨别,然后通过链式思维过程精确确定其位置。通过多个精心设计的模块,KptLLM擅长处理各种模态输入,促进对语义内容和关键点位置的解释。我们广泛的实验证明了KptLLM在各种关键点检测基准上的优越性及其在解释关键点方面的独特语义能力。
引用
@article{arxiv.2411.01846,
title = {KptLLM: Unveiling the Power of Large Language Model for Keypoint Comprehension},
author = {Jie Yang and Wang Zeng and Sheng Jin and Lumin Xu and Wentao Liu and Chen Qian and Ruimao Zhang},
journal= {arXiv preprint arXiv:2411.01846},
year = {2024}
}
备注
NeurIPS 2024