面向可解释多模态推荐的解耦图变分自编码器
信息检索
2024-02-27 v1 多媒体
摘要
多模态推荐系统将多模态信息(如文本描述、图像)融合到协同过滤框架中,以提供更准确的推荐。虽然多模态信息的引入可以增强这些系统的可解释性,但当前的多模态模型使用纠缠的数值向量表示用户和物品,使其难以解释。为了解决这个问题,我们提出了一种解耦图变分自编码器(DGVAE),旨在增强模型和推荐的可解释性。DGVAE首先利用最先进的多模态预训练技术将多模态信息投影到文本内容中,例如将图像转换为文本。然后,它构建一个冻结的物品-物品图,并利用简化的残差图卷积网络将内容和交互编码为两组解耦表示。DGVAE进一步通过互信息最大化正则化这些解耦表示,使从用户与物品交互中得到的表示与从文本内容中学习到的表示对齐。这种对齐有助于通过文本解释用户的二元交互。我们在三个真实世界数据集上的实证分析表明,DGVAE的性能显著优于最先进的基线,提升了10.02%。我们还提供了一个来自真实数据集的案例研究来说明DGVAE的可解释性。代码可在\url{https://github.com/enoche/DGVAE}获取。
引用
@article{arxiv.2402.16110,
title = {Disentangled Graph Variational Auto-Encoder for Multimodal Recommendation with Interpretability},
author = {Xin Zhou and Chunyan Miao},
journal= {arXiv preprint arXiv:2402.16110},
year = {2024}
}
备注
12 pages, 7 figures