PixVerve:将原生超高分辨率图像生成提升至1亿像素,附大规模高质量数据集
计算机视觉与模式识别
2026-05-20 v1
摘要
文本到图像(Text-to-Image,T2I)模型近期在1K和2K分辨率方面取得了显著进展。随着对更佳视觉体验的极端需求以及快速的成像技术发展,超高分辨率(Ultra-High-Resolution,UHR)图像生成的需求显著增长。然而,UHR图像生成面临诸多挑战,主要由于高分辨率内容的稀缺性和复杂性。本文首先引入PixVerve-95K数据集,这是一个高质量、开源的UHR T2I数据集,通过精心设计的数据管道筛选,包含95,000张涵盖多种场景的图像(每张图像的像素数至少为1亿)以及七维注释。基于我们大规模的图像-文本数据集,本文 pioneering(开创性)地将各种T2I基础模型扩展到原生1亿像素生成,采用三种训练方案。最终,利用常规指标和基于多模态大语言模型的评估,我们提出的PixVerve-Bench基准测试建立了涵盖视觉质量和语义对齐的UHR图像综合评估协议。在我们的基准上进行的大量实验结果以及对训练策略的深入探索,共同为未来的突破提供了宝贵的见解。
引用
@article{arxiv.2605.20147,
title = {PixVerve: Advancing Native UHR Image Generation to 100MP with a Large-Scale High-Quality Dataset},
author = {Haojun Chen and Haoyang He and Chengming Xu and Qingdong He and Junwei Zhu and Yabiao Wang and Zhucun Xue and Xianfang Zeng and Zhennan Chen and Xiaobin Hu and Hao Zhao and Yong Liu and Jiangning Zhang and Dacheng Tao},
journal= {arXiv preprint arXiv:2605.20147},
year = {2026}
}
备注
Project page is available at https://haojunchen663.github.io/projects/PixVerve/