中文

VITAL:面向视觉质量评估的视觉编码器中心预训练大多模态模型

计算机视觉与模式识别 2025-11-25 v1 人工智能

摘要

开发稳健的视觉质量评估(VQualA)大多模态模型(LMM)需要实现通用性、强大性与可迁�性。然而,现有VQualA LMM通常仅聚焦单一任务,依赖全参数微调,易过拟合于特定模态或任务类型,从而限制其泛化能力和可迁�性。为此,我们提出一种以视觉编码器为中心的生成式预训练流程,开发了VITAL系列 LMM。(1)我们采用机器执行的注释审查范式,构建了超过450万对视觉语言(VL)配对——目前为止最大的VQualA训练数据集。(2)我们采用多任务训练工作流程,同时提升模型在图像和视频模态下的定量评分精度,并强化其跨模态的质量解释能力。(3)基于视觉编码器,我们实现了高效的模型库扩展:模型库表现出强大的零样性能,且每个配对解码器仅需使用不足预训练数据1/1000的快速热身即可达到与完全训练版本相当的性能。总体而言,我们的工作为推动VQualA领域的基础 LMM 奠定了基础。

关键词

引用

@article{arxiv.2511.17962,
  title  = {VITAL: Vision-Encoder-centered Pre-training for LMMs in Visual Quality Assessment},
  author = {Ziheng Jia and Linhan Cao and Jinliang Han and Zicheng Zhang and Jiaying Qian and Jiarui Wang and Zijian Chen and Guangtao Zhai and Xiongkuo Min},
  journal= {arXiv preprint arXiv:2511.17962},
  year   = {2025}
}