HPE-CogVLM:通过头部姿态定位任务推进视觉语言模型
摘要
头部姿态估计需要深入理解 3D 空间关系以生成精确的偏航角、俯仰角和翻滚角。以往基于 CNN 的 HPE 模型依赖裁剪后的人体头部特写图像作为输入,在真实场景中往往缺乏鲁棒性。视觉语言模型能够通过其注意力机制在分析整张图像的同时聚焦于特定对象。在本文中,我们提出了一种新框架,通过利用被称为 CogVLM 的 VLM 的目标检测定位能力来提高 HPE 准确率。我们经验性地发现,直接对该 VLM 进行 LoRA 微调以执行 HPE 任务无法达到理想的 HPE 准确率,而某些模型合并方法虽能提高准确率,却经常产生混合的无效响应格式,难以同时处理目标检测和 HPE 任务。为了将 HPE 能力有效集成到 CogVLM 中,我们开发了一种新颖的基于 LoRA 层的模型合并方法。该合并方法应用了高余弦相似度阈值和“赢者通吃”层选择策略,在将注意力对齐到 HPE 任务的同时保留原始目标检测知识。它成功解决了混合无效响应格式的问题并提高了准确率。结果表明,在跨数据集评估中,我们的 HPE-CogVLM 相较于当前最先进的 CNN 模型 6DRepNet,平均绝对误差降低了 31.5%。此外,HPE-CogVLM 在所有 HPE 指标上均优于直接 LoRA 微调的 VLM 和基于任务算术合并的 VLM。
引用
@article{arxiv.2406.01914,
title = {HPE-CogVLM: Advancing Vision Language Models with a Head Pose Grounding Task},
author = {Yu Tian and Tianqi Shao and Tsukasa Demizu and Xuyang Wu and Hsin-Tai Wu},
journal= {arXiv preprint arXiv:2406.01914},
year = {2026}
}
备注
Accepted by IEEE Transactions on Circuits and Systems for Video Technology (TCSVT), 2026. This version includes major updates in methodology and experiments. The final version is available at IEEE Xplore