从 LLM 提取文本先验知识用于高效图像融合
计算机视觉与模式识别
2025-05-27 v3
摘要
多模态图像融合旨在从多个源输入合成单一综合图像。传统方法(如 CNN 和 GAN)虽高效,但难以处理低质量或复杂输入。近期基于文本引导的方法利用大模型先验知识克服这些限制,但计算开销大,尤其在内存和推理时间方面。为此,本文提出一种从大模型提取文本先验知识的新框架,在推理时无需文本指导,显著降低模型规模。该框架采用教师-学生架构,教师网络集成大模型先验,通过量身定制的蒸馏过程将知识传递给更小的学生网络。此外,本文引入空间-通道跨融合模块,以增强模型在空间和通道维度上利用文本先验的能力。本方法在计算效率与融合质量之间实现了有利的权衡。蒸馏后的网络仅需教师网络的 10% 参数和推理时间,却保留了 90% 性能,甚至超越现有 SOTA 方法。大量实验表明本方法有效。实现将以开源资源形式公开发布。
引用
@article{arxiv.2504.07029,
title = {Distilling Textual Priors from LLM to Efficient Image Fusion},
author = {Ran Zhang and Xuanhua He and Ke Cao and Liu Liu and Li Zhang and Man Zhou and Jie Zhang},
journal= {arXiv preprint arXiv:2504.07029},
year = {2025}
}
备注
Change to TCSVT format