中文

大型视觉语言模型的结构化与解缝适配用于多模态推荐

信息检索 2026-04-28 v2

摘要

多模态推荐通过利用视觉和文本信号提升准确率,其成功很大程度上取决于学习高质量的跨模态表征。最近在大型视觉语言模型(LVLMs)方面的进展提供了统一的多模态表征学习,使其成为具有前景的 backbone。然而,将LVLMs应用于推荐仍面临两个挑战:(i)表征错位,数据域之间的差异导致嵌入空间不对齐;(ii)微调期间梯度冲突,共享适配器导致干扰且判别力不足。为此,我们提出了SDA,即结构化与解缝适配(Structural and Disentangled Adaptation)框架,集成两个组件:跨模态结构对齐(CMSA)和模态解缝适配(MoDA)。CMSA利用类内结构作为软教师对嵌入进行对齐,而MoDA通过专业化、加锁的低秩路径来解缝梯度流动。实验在三个公开的Amazon数据集上表明,SDA能无缝集成到现有的多模态和序列推荐器中,对Hit@10平均提升6.15%,NDCG@10提升8.64%。在长尾物品上,最高可提升12.83%和18.70%,且推理开销最小。我们的代码和完整实验结果已发布于https://github.com/RaoZhongtao/SDA。

关键词

引用

@article{arxiv.2512.06883,
  title  = {Structural and Disentangled Adaptation of Large Vision Language Models for Multimodal Recommendation},
  author = {Zhongtao Rao and Peilin Zhou and Dading Chong and Zhiwei Chen and Shoujin Wang and Nan Tang},
  journal= {arXiv preprint arXiv:2512.06883},
  year   = {2026}
}

备注

Accepted to SIGIR '26