Q-Boost:关于低级多模态基础模型的视觉质量评估能力
计算机视觉与模式识别
2023-12-27 v1
摘要
多模态大语言模型(MLLM)的最新进展在复杂的高级视觉任务中展现了卓越的能力。然而,在视觉质量评估(低级视觉的一个重要方面)方面,对MLLM潜力的探索仍然有限。为了填补这一空白,我们引入了Q-Boost,一种新颖的策略,旨在增强低级MLLM在图像质量评估(IQA)和视频质量评估(VQA)任务中的能力,该策略围绕两个关键组成部分构建:1)三元色调整合:普通的提示设计仅在和两个极端之间摇摆。Q-Boost通过提示创新地引入了“中间地带”方法,允许进行更平衡和详细的评估。2)多提示集成:使用多个以质量为中心的提示来减轻偏差并获得更准确的评估。实验结果表明,配备Q-Boost策略的低级MLLM在IQA/VQA任务上表现出卓越的零样本性能。
引用
@article{arxiv.2312.15300,
title = {Q-Boost: On Visual Quality Assessment Ability of Low-level Multi-Modality Foundation Models},
author = {Zicheng Zhang and Haoning Wu and Zhongpeng Ji and Chunyi Li and Erli Zhang and Wei Sun and Xiaohong Liu and Xiongkuo Min and Fengyu Sun and Shangling Jui and Weisi Lin and Guangtao Zhai},
journal= {arXiv preprint arXiv:2312.15300},
year = {2023}
}