HCC-3D:面向视觉语言模型的层次性可补偿压缩
计算机视觉与模式识别
2025-11-14 v1
摘要
3D 理解近期受到广泛关注,借助视觉语言模型(VLM)实现点云与文本数据之间的多模态推理。当前的 3D-VLMs 直接将 3D 点云嵌入 3D 标记,遵循具有强大推理能力的大型 2D-VLMs。然而,该框架计算成本高昂,限制了其应用场景,我们识别出瓶颈在于处理 Large Language Model(LLM)部分中的所有 3D 标记。这引出了一个问题:如何在保持关键信息完整性的同时,降低由 3D 标记引入的计算开销?为此,我们提出了层次性可补偿压缩(HCC-3D),高效压缩 3D 标记,同时保持关键细节保留。具体而言,我们首先提出全局结构压缩(GSC),设计全局查询将所有 3D 标记压缩为少数关键标记,同时保留整体结构信息。随后,为补偿 GSC 中的信息损失,我们进一步提出自适应细节挖掘(ADM)模块,通过互补评分有选择地重新压缩受注意力不足但具有重要性的特征。大量实验表明,HCC-3D 不仅实现了相较于前述 3D-VLMs 的极端压缩比(约 98%),还实现了新的状态-of-the-art 性能,显示在效率和性能方面均取得显著提升。
引用
@article{arxiv.2511.09883,
title = {HCC-3D: Hierarchical Compensatory Compression for 98% 3D Token Reduction in Vision-Language Models},
author = {Liheng Zhang and Jin Wang and Hui Li and Bingfeng Zhang and Weifeng Liu},
journal= {arXiv preprint arXiv:2511.09883},
year = {2025}
}