基于模态引导的图专家混合网络与熵触发路由用于多模态推荐
人工智能
2026-02-27 v2
摘要
多模态推荐通过整合用户-物品交互与物品内容来提升排序效果,尤其在稀疏反馈和长尾分布场景中表现突出。然而,多模态信号本质上具有异构性,在特定情境下可能产生冲突,这使得有效融合既至关重要又充满挑战。现有方法常依赖共享的融合路径,导致表征被纠缠和模态不平衡。为此,我们提出了MAGNET(Modality-Guided Mixture of Adaptive Graph Experts Network with Progressive Entropy-Triggered Routing for Multimodal Recommendation),即一种具备可控性、稳定性和可解释性的多模态融合框架。MAGNET将交互条件驱动的专家路由与结构感知的图增强相结合,使“融合什么”和“如何融合”均可被显式控制且具备可解释性。在表征层面,双视图图学习模块通过内容诱导的边扩展交互图,既提高了稀疏和长尾物品的覆盖率,又通过并行编码和轻量级融合保留了协同结构。在融合层面,MAGNET采用具有明确模态角色(支配型、平衡型、补充型)的结构化专家,实现对行为、视觉和文本线索的更具可解释性和适应性的组合。为进一步稳定稀疏路由并防止专家崩溃,我们引入两种熵加权机制,通过监控路由熵实现自动训练阶段的切换:从早期覆盖导向的训练 regime 过渡到后期专精导向的训练 regime,逐步平衡专家利用率与路由置信度。大量实验表明,在公开基准数据集上,MAGNET consistently 超越了强基线。
引用
@article{arxiv.2602.20723,
title = {Modality-Guided Mixture of Graph Experts with Entropy-Triggered Routing for Multimodal Recommendation},
author = {Ji Dai and Quan Fang and Dengsheng Cai},
journal= {arXiv preprint arXiv:2602.20723},
year = {2026}
}