基于深度特征工程的文本-图像联合嵌入学习以实现高效跨模态检索
计算机视觉与模式识别
2021-10-25 v1 信息检索
摘要
本文提出一种两阶段深度特征工程框架,用于高效学习语义增强的联合嵌入,该框架将预处理中的深度特征工程与文本-图像联合嵌入模型训练明确分离。我们使用 Recipe1M 数据集进行技术描述与实证验证。在预处理中,我们通过将深度特征工程与从原始文本-图像输入数据导出的语义上下文特征相结合来执行深度特征工程。我们利用 LSTM 识别关键术语,来自 BERT 家族的深度 NLP 模型、TextRank 或 TF-IDF 在为各关键术语生成向量表示(使用 word2vec)之前产生其排序分数。我们利用 wideResNet50 与 word2vec 提取并编码食物图像的图像类别语义,以助所学配方与图像嵌入在联合隐空间中的语义对齐。在联合嵌入学习中,我们通过优化带软间隔与双负采样的 batch-hard 三元组损失函数来进行深度特征工程,同时考虑基于类别的对齐损失与基于判别器的对齐损失。大量实验表明,我们的具深度特征工程的 SEJE 方法显著优于当前最优方法。
引用
@article{arxiv.2110.11592,
title = {Learning Text-Image Joint Embedding for Efficient Cross-Modal Retrieval with Deep Feature Engineering},
author = {Zhongwei Xie and Ling Liu and Yanzhao Wu and Luo Zhong and Lin Li},
journal= {arXiv preprint arXiv:2110.11592},
year = {2021}
}
备注
accepted by ACM Transactions on Information Systems(TOIS). arXiv admin note: text overlap with arXiv:2108.00705, arXiv:2108.03788