大型视觉语言模型的结构化与解缝适配用于多模态推荐
信息检索
2026-04-28 v2
摘要
多模态推荐通过利用视觉和文本信号提升准确率,其成功很大程度上取决于学习高质量的跨模态表征。最近在大型视觉语言模型(LVLMs)方面的进展提供了统一的多模态表征学习,使其成为具有前景的 backbone。然而,将LVLMs应用于推荐仍面临两个挑战:(i)表征错位,数据域之间的差异导致嵌入空间不对齐;(ii)微调期间梯度冲突,共享适配器导致干扰且判别力不足。为此,我们提出了SDA,即结构化与解缝适配(Structural and Disentangled Adaptation)框架,集成两个组件:跨模态结构对齐(CMSA)和模态解缝适配(MoDA)。CMSA利用类内结构作为软教师对嵌入进行对齐,而MoDA通过专业化、加锁的低秩路径来解缝梯度流动。实验在三个公开的Amazon数据集上表明,SDA能无缝集成到现有的多模态和序列推荐器中,对Hit@10平均提升6.15%,NDCG@10提升8.64%。在长尾物品上,最高可提升12.83%和18.70%,且推理开销最小。我们的代码和完整实验结果已发布于https://github.com/RaoZhongtao/SDA。
引用
@article{arxiv.2512.06883,
title = {Structural and Disentangled Adaptation of Large Vision Language Models for Multimodal Recommendation},
author = {Zhongtao Rao and Peilin Zhou and Dading Chong and Zhiwei Chen and Shoujin Wang and Nan Tang},
journal= {arXiv preprint arXiv:2512.06883},
year = {2026}
}
备注
Accepted to SIGIR '26