中文

VisualCritic: 使 LMMs 像人类一样感知视觉质量

计算机视觉与模式识别 2024-03-20 v1

摘要

目前,大型多模态模型在理解和生成视觉信号方面展现出了令人印象深刻的泛化能力。然而,它们目前仍缺乏类似于人类感知的低层视觉质量感知能力。LMMs 能否实现这一点并在此方面展现出同等程度的泛化能力?如果是,不仅可以进一步增强 LMMs 的多功能性,还能解决视觉质量评估领域中跨数据集性能不佳的挑战。在本文中,我们探讨了这个问题并给出了“是!”的答案。作为这一初步探索的成果,我们提出了 VisualCritic,这是首个用于广谱图像主观质量评估的 LMM。VisualCritic 可以开箱即用地跨多种数据使用,无需像传统专家模型那样进行特定数据集的适应操作。作为一种遵循指令的 LMM,VisualCritic 具备以下新能力:(1) 根据平均主观评分(MOS)、噪声度、色彩丰富度、锐度等数值指标定量测量给定图像的感知质量;(2) 定性评估视觉质量并提供可解释的描述;(3) 辨别给定图像是 AI 生成的还是摄影图像。大量实验通过在 AI 生成图像和摄影图像上与其他开源 LMMs 及传统专家模型进行比较,证明了 VisualCritic 的有效性。

关键词

引用

@article{arxiv.2403.12806,
  title  = {VisualCritic: Making LMMs Perceive Visual Quality Like Humans},
  author = {Zhipeng Huang and Zhizheng Zhang and Yiting Lu and Zheng-Jun Zha and Zhibo Chen and Baining Guo},
  journal= {arXiv preprint arXiv:2403.12806},
  year   = {2024}
}