中文

Photon:加速多模态大语言模型的体积理解

计算机视觉与模式识别 2026-03-27 v1 人工智能

摘要

多模态大语言模型在临床视觉问答任务中表现前景广阔,但由于高计算成本,难以扩展到3D影像。现有方法常依赖2D切片或固定长度token压缩,破坏体积连续性,掩盖细微发现。我们提出Photon框架,通过可变长度token序列表示3D医学体积。Photon引入指令条件化token调度和代理梯度传播,在训练和推理期间自适应减少token数量,降低计算成本同时缓解冗余token导致的注意力稀释。它采用自定义反向传播规则配合梯度恢复,实现离散token丢弃下的可微优化。为稳定token压缩并确保可靠利用视觉证据,Photon进一步应用正则化目标,缓解语言-only偏置并提升可靠性。在多样化的医学视觉问答任务实验中,Photon实现了状态突破的准确率,同时减少资源消耗,加速训练和推理。

关键词

引用

@article{arxiv.2603.25155,
  title  = {Photon: Speedup Volume Understanding with Efficient Multimodal Large Language Models},
  author = {Chengyu Fang and Heng Guo and Zheng Jiang and Chunming He and Xiu Li and Minfeng Xu},
  journal= {arXiv preprint arXiv:2603.25155},
  year   = {2026}
}

备注

Accepted by ICLR 2026