中文

KptLLM++: 面向通用关键点理解的大语言模型

计算机视觉与模式识别 2025-07-16 v1

摘要

多模态大语言模型(MLLM)的出现彻底革新了图像理解,通过桥接文本和视觉模态实现了跨模态的语义交互。然而,这些模型往往难以捕捉细粒度语义信息,例如对物体关键点的精准识别与分析。作为结构感知、像素级且紧凑的物体表征,关键点在细粒度图像分析、物体检索和行为识别等应用中发挥着关键作用。本文提出了KptLLM++,一种专为通用关键点理解而设计的新型多模态大语言模型,通过集成多种输入模态并受用户定义指令引导,实现了关键点的感知。KptLLM++通过一种新颖的“识别-检测”范式,首先解释关键点的语义,然后通过结构化的链式思考推理机制定位其精确位置。为推动性能的边界,我们将训练数据集规模扩展到50万以上样本,涵盖多样化的物体、关键点类别、图像风格和场景,并包含复杂遮挡。这种大规模扩展使KptLLM++能够释放其潜力,实现卓越的准确率和泛化能力。在多个关键点检测基准测试上的全面实验表明,其实现了最先进的性能,凸显了其作为统一解决方案处理细粒度图像理解以及对人类与AI交互变革性影响的潜力。

关键词

引用

@article{arxiv.2507.11102,
  title  = {KptLLM++: Towards Generic Keypoint Comprehension with Large Language Model},
  author = {Jie Yang and Wang Zeng and Sheng Jin and Lumin Xu and Wentao Liu and Chen Qian and Zhen Li and Ruimao Zhang},
  journal= {arXiv preprint arXiv:2507.11102},
  year   = {2025}
}

备注

Extended Version of KptLLM. arXiv admin note: text overlap with arXiv:2411.01846