Q-Instruct:提升多模态基础模型的低级视觉能力
计算机视觉与模式识别
2023-11-14 v1 多媒体
摘要
以GPT-4V为代表的多模态基础模型,为低级视觉感知与理解任务带来了新范式,可在单一模型中响应广泛的自然人类指令。尽管现有基础模型在低级视觉任务上展现出令人振奋的潜力,其相关能力仍初步且有待提升。为增强这些模型,我们开展大规模主观实验,收集大量关于低级视觉的真实人类反馈。每条反馈遵循一条路径:从对低级视觉外观(如图像清晰度、颜色、亮度)的详细描述开始,以总体结论结束,平均长度45词。所构建的**Q-Pathway**数据集包含对18,973张具有多样低级外观图像的58K条详细人类反馈。此外,为使基础模型稳健响应多样问题类型,我们设计GPT参与的转换,将这些反馈处理为多样格式的200K指令-响应对。实验结果表明,**Q-Instruct**持续提升了若干基础模型的低级感知与理解能力。我们期望我们的数据集能为通用智能像人类一样感知、理解低级视觉外观并评估视觉质量的未来铺路。我们的数据集、模型库与演示发布于:https://q-future.github.io/Q-Instruct。
引用
@article{arxiv.2311.06783,
title = {Q-Instruct: Improving Low-level Visual Abilities for Multi-modality Foundation Models},
author = {Haoning Wu and Zicheng Zhang and Erli Zhang and Chaofeng Chen and Liang Liao and Annan Wang and Kaixin Xu and Chunyi Li and Jingwen Hou and Guangtao Zhai and Geng Xue and Wenxiu Sun and Qiong Yan and Weisi Lin},
journal= {arXiv preprint arXiv:2311.06783},
year = {2023}
}
备注
16 pages, 11 figures, page 12-16 as appendix