用于跨模态联合嵌入学习的高效深度特征校准
计算机视觉与模式识别
2021-08-10 v2 多媒体
摘要
本文提出一种两阶段深度特征校准框架,用于高效学习语义增强的文本-图像跨模态联合嵌入,该框架将数据预处理中的深度特征校准与联合嵌入模型训练明确分离。我们使用 Recipe1M 数据集进行技术说明与实证验证。在预处理中,我们通过将深度特征工程与从原始文本-图像输入数据导出的语义上下文特征相结合来执行深度特征校准。我们利用 LSTM 识别关键术语,使用 NLP 方法在生成关键术语特征前为关键术语产生排序分数。我们利用 wideResNet50 提取并编码图像类别语义,以辅助所学食谱与图像嵌入在联合潜在空间中的语义对齐。在联合嵌入学习中,我们通过优化带软边界与双重负采样的 batch-hard 三元组损失函数来进行深度特征校准,同时利用基于类别的对齐损失与基于判别器的对齐损失。大量实验表明,我们采用深度特征校准的 SEJE 方法显著优于当前最优方法。
引用
@article{arxiv.2108.00705,
title = {Efficient Deep Feature Calibration for Cross-Modal Joint Embedding Learning},
author = {Zhongwei Xie and Ling Liu and Lin Li and Luo Zhong},
journal= {arXiv preprint arXiv:2108.00705},
year = {2021}
}
备注
accepted by ACM ICMI 2021 conference