PIT-QMM:用于无参考点云质量评估的大型多模态模型
计算机视觉与模式识别
2025-10-10 v1
摘要
大型多模态模型 (LMM) 最近在图像和视频质量评估领域实现了显著进展,但这一进展尚未充分应用于三维资产领域。我们关注利用这些模型进行无参考点云质量评估 (NR-PCQA),即在没有参考源的情况下自动评估点云感知质量。我们首先观察到,不同数据模态——文本描述、二维投影和三维点云视图——提供有关点云质量的互补信息。随后我们构建PIT-QMM,一种新的NR-PCQA LMM,能够端到端地消费文本、图像和点云,以预测质量评分。大量实验表明,我们提出的方法在热门基准数据集上以显著的优势超过最先进的方法,同时所需的训练迭代次数更少。我们还展示了该框架能够实现失真局部化和识别,这为模型可解释性和交互性开辟了新方向。代码和数据集已在 https://www.github.com/shngt/pit-qmm 提供。
引用
@article{arxiv.2510.07636,
title = {PIT-QMM: A Large Multimodal Model For No-Reference Point Cloud Quality Assessment},
author = {Shashank Gupta and Gregoire Phillips and Alan C. Bovik},
journal= {arXiv preprint arXiv:2510.07636},
year = {2025}
}
备注
Oral presentation at ICIP 2025