中文

迈向开放式的视觉质量比较

计算机视觉与模式识别 2024-03-05 v2

摘要

比较设置(例如成对选择、列表排序)已被广泛的主观图像质量评估(IQA)研究采用,因为它本质上标准化了不同观察者之间的评估标准,并提供了更明确的回答。在本工作中,我们将新兴的大规模多模态模型(LMMs)的能力扩展到进一步将视觉质量比较推进到开放式设置,即:1) 能够回答关于质量比较的开放范围问题;2) 能够提供超越直接答案的详细推理。为此,我们提出了 Co-Instruct。为了训练这个首个开源的开放式视觉质量比较器,我们收集了 Co-Instruct-562K 数据集,数据来源包括:(a) 大语言模型(LLM)合并的单图像质量描述,(b) GPT-4V“教师”对未标记数据的响应。此外,为了更好地评估这一设置,我们提出了 MICBench,这是首个针对 LMMs 的多图像比较基准。我们证明,Co-Instruct 不仅在平均准确率上比最先进的开源 LMMs 高出 30%,而且在现有相关基准和所提出的 MICBench 上均优于 GPT-4V(其教师模型)。我们的模型已发布在 https://huggingface.co/q-future/co-instruct。

关键词

引用

@article{arxiv.2402.16641,
  title  = {Towards Open-ended Visual Quality Comparison},
  author = {Haoning Wu and Hanwei Zhu and Zicheng Zhang and Erli Zhang and Chaofeng Chen and Liang Liao and Chunyi Li and Annan Wang and Wenxiu Sun and Qiong Yan and Xiaohong Liu and Guangtao Zhai and Shiqi Wang and Weisi Lin},
  journal= {arXiv preprint arXiv:2402.16641},
  year   = {2024}
}

备注

Fix typos