CHEF:面向食物领域检索的跨模态层次化嵌入
计算机视觉与模式识别
2021-02-05 v1
摘要
尽管存在大量多模态数据(如图像-文本对),但在理解这些数据结构中的个体实体及其不同作用方面,已有工作甚少。本文将烹饪食谱中的实体及其对应重要性自动发现作为一个视觉-语言关联问题加以研究。更具体地,我们引入了一种新颖的跨模态学习框架,用于在食物图像-食谱关联与检索任务中联合建模图像与文本的潜在表示。该模型能够发现图像与文本之间,以及食谱文本部分(包括标题、食材和烹饪说明)之间复杂的功能性与层次化关系。我们的实验表明,通过在计算跨模态检索框架中采用高效的树结构长短期记忆(Long Short-Term Memory, LSTM)作为文本编码器,我们不仅能无需显式监督即可识别食谱描述中的主要食材与烹饪动作,还能学习到更具意义的食物食谱特征表示,适用于具有挑战性的跨模态检索与食谱改编任务。
引用
@article{arxiv.2102.02547,
title = {CHEF: Cross-modal Hierarchical Embeddings for Food Domain Retrieval},
author = {Hai X. Pham and Ricardo Guerrero and Jiatong Li and Vladimir Pavlovic},
journal= {arXiv preprint arXiv:2102.02547},
year = {2021}
}
备注
22 pages, accepted in AAAI 2021