通过端边协同混合超分辨率增强文本到图像生成
计算机视觉与模式识别
2026-01-22 v1
摘要
人工智能生成内容 (AIGC) 取得了显著进展,其中高分辨率文本到图像 (T2I) 生成对于提升用户体验质量 变得日益关键。尽管资源受限的边缘计算能够充分支持快速的低保真 T2I 生成,但实现高分辨率输出仍面临以延迟为代价确保图像保真度的挑战。为了解决这一问题,我们首先研究了用于图像增强的超分辨率 (SR) 方法的性能,证实了一个基本的权衡:基于轻量级学习的 SR 难以恢复精细细节,而基于扩散的 SR 以巨大的计算成本实现了更高的保真度。受这些观察的启发,我们提出了一种端边协同的生成-增强框架。在接收到 T2I 生成任务后,系统首先在边缘侧基于自适应选择的去噪步数和超分辨率尺度生成低分辨率图像,随后将其划分为图像块并由区域感知的混合 SR 策略处理。该策略对前景图像块应用基于扩散的 SR 模型以恢复细节,对背景图像块应用轻量级学习的 SR 模型以实现高效放大,最终将增强后的图像块拼接成高分辨率图像。实验表明,与基线相比,我们的系统在保持具有竞争力的图像质量的同时,将服务延迟降低了 33%。
引用
@article{arxiv.2601.14741,
title = {Enhancing Text-to-Image Generation via End-Edge Collaborative Hybrid Super-Resolution},
author = {Chongbin Yi and Yuxin Liang and Ziqi Zhou and Peng Yang},
journal= {arXiv preprint arXiv:2601.14741},
year = {2026}
}
备注
Accpeted by ICC 2026