通过可微分渲染与 MLLM 实现通用骨架理解
计算机视觉与模式识别
2026-05-22 v5
摘要
多模态大语言模型(MLLM)具备强大的视觉语言推理能力,但无法处理结构化、非视觉数据,如人类骨架。现有方法要么将骨架动态压缩为有损特征向量以进行文本对齐,要么将运动量化为离散 token,跨异构骨架格式的泛化性差。我们提出了 SkeletonLLM,通过将任意骨架序列转换为 MLLM 原生视觉模态的方式,实现了骨架的通用理解。其核心是 DrAction,一个可微分且格式无关的渲染器,将骨架运动学转换为紧凑的图像序列。由于该流程是端到端可微分的,MLLM 的梯度可以直接指导渲染生成具有任务信息的视觉 token。为进一步提升推理能力,我们引入了合作训练策略:因果推理蒸馏从教师模型传递结构化、逐步推理,而判别式微调则锐化混淆动作之间的决策边界。SkeletonLLM 在开放词汇动作识别中表现出强大的泛化能力,其所学的推理能力自然也扩展到跨异构骨架格式的动作描述和问答任务——为将 MLLM 应用于非原生模态指明了可行之路。代码:https://github.com/wangzy01/SkeletonLLM
引用
@article{arxiv.2603.18003,
title = {Universal Skeleton Understanding via Differentiable Rendering and MLLMs},
author = {Ziyi Wang and Peiming Li and Xinshun Wang and Yang Tang and Kai-Kuang Ma and Mengyuan Liu},
journal= {arXiv preprint arXiv:2603.18003},
year = {2026}
}
备注
Accepted by ICML 2026