DualComp:基于统一双模态无损压缩器的端到端学习
计算机视觉与模式识别
2025-05-23 v1 人工智能
多媒体
摘要
大多数基于学习的无损压缩器针对单一模态进行设计,需要针对多模态数据使用独立模型且缺乏灵活性。然而,不同模态在格式和统计属性上差异显著,使用缺乏模态特定适应性的压缩器效果不佳。虽然多模态大语言模型(MLLMs)为模态统一压缩提供了潜在解决方案,但其过于复杂的复杂度阻碍了实际部署。为此,我们聚焦于两种最常见的模态——图像和文本,提出 DualComp,即第一个统一且轻量级的基于学习的双模态无损压缩器。基于轻量级主干网络,DualComp 包含三项关键结构性改进,以处理模态异质性:模态统一标记化、模态切换情境学习和模态路由混合专家。还采用一种重新参数化训练策略以提升压缩性能。DualComp 集成了模态特定参数和共享参数,以实现高效的参数利用,使其在桌面 CPU 上实现近实时推理(200KB/s)。凭借更少的参数,DualComp 在文本和图像数据集上实现的压缩性能与 SOTA LLM 方法持平。其简化的单模态变体仅使用 1.2% 的模型规模即可将 Kodak 数据集上的最佳图像压缩器提升约 9%。
引用
@article{arxiv.2505.16256,
title = {DualComp: End-to-End Learning of a Unified Dual-Modality Lossless Compressor},
author = {Yan Zhao and Zhengxue Cheng and Junxuan Zhang and Qunshan Gu and Qi Wang and Li Song},
journal= {arXiv preprint arXiv:2505.16256},
year = {2025}
}
备注
18 pages, 11 figures, 7 tables