多模态推荐中的模态平衡学习
信息检索
2024-08-14 v1 计算机视觉与模式识别
摘要
已提出许多推荐模型以有效地将多模态内容信息整合到传统协同过滤框架中。预期将多模态信息的使用能够提供更全面的信息并lead to superior performance。然而,多模态集成常遇到模态不平衡问题:由于不同模态信息的不平衡,跨所有模态优化相同目标导致 weak 模态的过度优化问题,其收敛速度较慢或性能较低。更糟糕的是,我们发现在多模态推荐模型中,所有模态都受到优化不足的问题。为解决这些问题,我们提出了一种 Counterfactual Knowledge Distillation 方法,可解决不平衡问题并充分利用所有模态。通过模态特定的知识蒸馏,它能够指导多模态模型从单模态教师那里学习模态特定知识。我们还设计了一种新型的通用-特定蒸馈损失,以指导多模态学生从教师那里学习更广泛、更深入的知识。此外,为在训练期间自适应地重新校准多模态模型对弱模态的关注,我们使用反事实推断技术估计每个模态对训练目标的因果效应,通过该方法可确定弱模态、量化不平衡程度并相应重新加权蒸馈损失。我们的方法可作为 late-fusion 和 early-fusion backbone 的即插即用模块。广泛实验表明,我们的方法可显著提升性能。源代码将发布于 \url{https://github.com/CRIPAC-DIG/Balanced-Multimodal-Rec}。
引用
@article{arxiv.2408.06360,
title = {Modality-Balanced Learning for Multimedia Recommendation},
author = {Jinghao Zhang and Guofan Liu and Qiang Liu and Shu Wu and Liang Wang},
journal= {arXiv preprint arXiv:2408.06360},
year = {2024}
}
备注
ACM Multimedia 2024 (Oral)