LocLLM:基于大语言模型的通用人类关键点定位
计算机视觉与模式识别
2024-06-10 v1
摘要
现有人类关键点定位模型的容量受限于训练数据提供的关键点先验。为缓解这一限制并追求更通用的模型,本文从不同的视角出发,通过基于文本描述中关键点线索进行推理来实现位置定位。我们提出 LocLLM,即首个基于大语言模型(LLM)的关键点定位模型,该模型接受图像和文本指令作为输入,并输出所需的关键点坐标。LocLLM 利用 LLM 的强大推理能力,以及文本描述中关于关键点类型、位置和关系的线索进行关键点定位。为有效微调 LocLLM,我们构建基于定位的指令式对话,将关键点描述与输入图像中的对应坐标相连接,并在参数高效的训练管道中对整个模型进行微调。LocLLM 在标准 2D/3D 关键点定位基准测试中表现出卓越的性能。此外,融合语言线索使 LocLLM 在跨数据集关键点定位中展现出卓越的灵活性和泛化能力,甚至能够检测在训练期间未出现的新型关键点。
引用
@article{arxiv.2406.04659,
title = {LocLLM: Exploiting Generalizable Human Keypoint Localization via Large Language Model},
author = {Dongkai Wang and Shiyu Xuan and Shiliang Zhang},
journal= {arXiv preprint arXiv:2406.04659},
year = {2024}
}
备注
CVPR2024