中文

Q-Align:通过离散文本定义等级教授LMM进行视觉评分

计算机视觉与模式识别 2023-12-29 v1 计算与语言 机器学习

摘要

在线视觉内容的爆炸式增长凸显了对精确机器评估器的需求,以稳健地评估各种类型视觉内容的分数。虽然最近的研究表明大型多模态模型(LMM)在广泛的相关领域具有非凡潜力,但在这项工作中,我们探索如何教授它们进行与人类意见一致的视觉评级。观察到人类评分者在主观研究中只学习和判断离散的文本定义等级,我们提出模拟这一主观过程,并用文本定义的评级等级而非分数来教授LMM。所提出的Q-Align在原始LMM结构下,在图像质量评估(IQA)、图像美学评估(IAA)以及视频质量评估(VQA)任务上均达到了最先进的性能。借助该教学大纲,我们进一步将三个任务统一到一个模型中,称为OneAlign。在我们的实验中,我们证明了基于离散等级的教学大纲优于基于直接分数的变体。我们的代码和预训练权重已在https://github.com/Q-Future/Q-Align发布。

关键词

引用

@article{arxiv.2312.17090,
  title  = {Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined Levels},
  author = {Haoning Wu and Zicheng Zhang and Weixia Zhang and Chaofeng Chen and Liang Liao and Chunyi Li and Yixuan Gao and Annan Wang and Erli Zhang and Wenxiu Sun and Qiong Yan and Xiongkuo Min and Guangtao Zhai and Weisi Lin},
  journal= {arXiv preprint arXiv:2312.17090},
  year   = {2023}
}

备注

Technical Report