中文

FLUID:基于 Token 蒸馏的流-潜统一集成,用于专家专化的多模态学习

社会与信息网络 2025-08-18 v1 人工智能

摘要

多模态分类需要对视觉和文本信号进行稳健的集成,但常见的融合策略脆弱且易受模式特定噪声的影响。在本文中,我们提出了 \textsc{FLUID}-Flow-Latent Unified Integration via Token Distillation for Expert Specialization,即一种原则性的 token 级别管道,提高了跨模态的鲁棒性和可扩展性。\textsc{FLUID} 包含三个核心要素:(1) \emph{Q-transforms},可学习的查询 token 用于蒸馏和保留来自模式特定 backbone 的显著 token 级别特征;(2) 两个阶段的融合方案通过对比对齐实现跨模态一致性,然后通过一个门控机制和一个 \emph{Q-bottleneck} 进行自适应、任务感知的融合,以选择性地压缩信息以供下游推理使用;(3) 在预测时间部署一个轻量级、负载均衡的 Mixture-of-Experts,使其能够高效地针对多样化语义模式进行专门化。广泛的实验表明,\textsc{FLUID} 在 GLAMI-1M 数据集上实现了 91% 的准确率,显著优于先前的基准,并对标签噪声、长尾类别不平衡和语义异构性表现出强大的鲁棒性。针对性的消融研究 corroborates 了所提出各要素的个人益处以及协同效应,使 \textsc{FLUID} 成为一种可扩展、抗噪声的多模态产品分类解决方案。

关键词

引用

@article{arxiv.2508.07264,
  title  = {FLUID: Flow-Latent Unified Integration via Token Distillation for Expert Specialization in Multimodal Learning},
  author = {Van Duc Cuong and Ta Dinh Tam and Tran Duc Chinh and Nguyen Thi Hanh},
  journal= {arXiv preprint arXiv:2508.07264},
  year   = {2025}
}