LIMSSR:基于训练时不完整多模态观察的 LLM 驱动序列到分数推理
计算机视觉与模式识别
2026-05-04 v1
摘要
现实世界的多模态学习常受缺失模态的阻碍。尽管不完整多模态学习 (IML) 受到关注,但现有方法通常依赖于训练时完全可用模态的不切实际假设,以提供重建监督或跨模态先验。本文针对训练时不完整观察的更具挑战性的 IML 设置提出方法,这预cludes 依赖于对完整数据的“全知视角”。我们提出 LIMSSR(LLM 驱动的不完整多模态序列到分数推理),将挑战重新表述为条件序列推理任务。LIMSSR 利用大语言模型通过基于提示的上下文感知模态插值和多维表示融合,从可用上下文中推断潜在语义,而无需直接重建。为缓解幻觉,我们引入面具感知双路径聚合,以动态校准推理不确定性。在三个行动质量评估数据集上的大量实验表明,LIMSSR 在不依赖完整训练数据的情况下显著优于最先进的基线,确立了数据高效多模态学习的新范式。代码地址:https://github.com/XuHuangbiao/LIMSSR。
引用
@article{arxiv.2605.00434,
title = {LIMSSR: LLM-Driven Sequence-to-Score Reasoning under Training-Time Incomplete Multimodal Observations},
author = {Huangbiao Xu and Huanqi Wu and Xiao Ke and Yuxin Peng},
journal= {arXiv preprint arXiv:2605.00434},
year = {2026}
}
备注
ICML 2026 [Spotlight]