基于协同适配器的机器视觉压缩结构-语义共调优:什么以及在哪里适配
太阳与恒星天体物理
2026-04-14 v1 机器学习
摘要
参数高效微调预训练编解码器是图像压缩中面向人类和机器视觉的有前景的方向。虽然大多数现有工作主要关注对编码器-解码器背骨架中的特征结构进行调优,但对熵模型中统计语义的适配仍受到有限关注,尽管后者负责预测潜在特征的概率分布。我们的分析表明, naively 将适配器插入到熵模型中可能导致次优结果,凸显适配器基准调优的有效性在于跨压缩管道中适配器类型与位置之间的协调。因此,我们引入结构-语义共调优(S2-CoT)框架,通过两种专用的、协同的适配器实现上述协调:结构保真适配器(SFA)和语义上下文适配器(SCA)。SFA 集成到编码器-解码器中,通过动态融合空间和频率信息来保持高保真表示;与此同时,SCA 调整熵模型以与 SFA 调优的特征对齐,通过细化通道上下文实现更高效的统计编码。通过联合优化,S2-CoT 将潜在的性能下降转化为协同收益,仅用极少的可训练参数即可在四个多样化基准编解码器上实现最先进的结果,接近完整微调性能。代码可在 https://github.com/Brock-bit4/S2-CoT 查阅。
引用
@article{arxiv.2604.10016,
title = {Predicting Associations between Solar Flares and Coronal Mass Ejections Using SDO/HMI Magnetograms and a Hybrid Neural Network},
author = {Jialiang Li and Vasyl Yurchyshyn and Jason T. L. Wang and Haimin Wang and Manolis K. Georgoulis and Wen He and Yasser Abduallah and Hameedullah A. Farooki and Yan Xu},
journal= {arXiv preprint arXiv:2604.10016},
year = {2026}
}
备注
14 pages, 8 figures