一图胜千言?面向电子商务产品分类的深度多模态融合架构
计算机视觉与模式识别
2016-11-30 v1 计算与语言
摘要
在现代电子商务中,将产品精确高效地分类是一项重大挑战。每日上传的大量新产品以及类别的动态变化,催生了对能够降低人工编辑成本和时间的机器学习模型的需求。本文提出了一种利用文本和图像输入进行多模态产品分类的决策级融合方法。我们为每种输入源训练了特定输入的最先进深度神经网络,展示了将它们融合成一个多模态架构的潜力,并训练了一个新颖的策略网络来学习在它们之间进行选择。最后,我们在从 Walmart.com 收集的真实大规模产品分类数据集上证明,我们的多模态网络在 top-1 准确率上优于两种单一网络。虽然我们专注于表征电子商务领域的图像-文本融合,但我们的算法可以轻松应用于其他模态,如音频、视频、物理传感器等。
引用
@article{arxiv.1611.09534,
title = {Is a picture worth a thousand words? A Deep Multi-Modal Fusion Architecture for Product Classification in e-commerce},
author = {Tom Zahavy and Alessandro Magnani and Abhinandan Krishnan and Shie Mannor},
journal= {arXiv preprint arXiv:1611.09534},
year = {2016}
}