学习 TFIDF 增强联合嵌入用于菜谱-图像跨模态检索服务
计算机视觉与模式识别
2021-08-03 v1 信息检索
摘要
人们广泛认识到,由于烹饪过程中食材组成的多样性和形变,学习菜谱与图像的联合嵌入具有挑战性。我们提出一种多模态语义增强联合嵌入方法(MSJE),用于学习两种模态(文本和图像)之间的公共特征空间,最终目标是提供高性能的跨模态检索服务。我们的 MSJE 方法有三个独特特征。首先,我们从菜谱的标题、食材和烹饪说明中提取 TFIDF 特征。通过结合 LSTM 学习到的特征与其 TFIDF 特征来确定词序列的重要性,我们将菜谱编码为 TFIDF 加权向量,以捕捉显著的关键词以及这些关键词在相应烹饪说明中的使用方式。其次,我们将菜谱 TFIDF 特征与通过两阶段 LSTM 网络提取的菜谱序列特征相结合,这能有效捕捉菜谱与其关联图像之间的独特关系。第三,我们进一步引入 TFIDF 增强的类别语义,以改进图像模态的映射,并在跨模态联合嵌入的迭代学习中调节相似度损失函数。在基准数据集 Recipe1M 上的实验表明,所提方法优于当前最优(SOTA)方法。
引用
@article{arxiv.2108.00724,
title = {Learning TFIDF Enhanced Joint Embedding for Recipe-Image Cross-Modal Retrieval Service},
author = {Zhongwei Xie and Ling Liu and Yanzhao Wu and Lin Li and Luo Zhong},
journal= {arXiv preprint arXiv:2108.00724},
year = {2021}
}
备注
accepted by IEEE Transactions on Services Computing