基于最优传输的半监督多模态多示例多标签深度网络
机器学习
2021-04-20 v1 计算机视觉与模式识别
摘要
复杂对象通常具有多个标签,并可由多种模态表示,例如复杂文章包含文本与图像信息以及多个标注。以往方法假设同质多模态数据是一致的,而在实际应用中,原始数据是杂乱的,例如文章由数量可变且不一致的文本与图像示例构成。因此,多模态多示例多标签(M3)学习为处理此类任务提供了框架并展现出优异性能。然而,M3 学习面临两个主要挑战:1)如何有效利用标签相关性;2)如何借助多模态学习处理未标注示例。为解决这些问题,我们首先提出一种新颖的多模态多示例多标签深度网络(M3DN),其在端到端多模态深度网络中考虑 M3 学习,并利用不同模态包级预测间的一致性原理。基于 M3DN,我们利用最优传输学习潜在真实标签度量。此外,我们引入外部未标注多模态多示例数据,并提出 M3DNS,其考虑单模态的示例级自编码器与改进的包级最优传输以加强模态间一致性。从而 M3DNS 能更好地预测标签并同时利用标签相关性。在基准数据集与真实世界 WKG Game-Hub 数据集上的实验验证了所提方法的有效性。
引用
@article{arxiv.2104.08489,
title = {Semi-Supervised Multi-Modal Multi-Instance Multi-Label Deep Network with Optimal Transport},
author = {Yang Yang and Zhao-Yang Fu and De-Chuan Zhan and Zhi-Bin Liu and Yuan Jiang},
journal= {arXiv preprint arXiv:2104.08489},
year = {2021}
}