通过对偶高斯视觉-语义嵌入解释时尚专用属性
计算机视觉与模式识别
2022-11-09 v2 机器学习
摘要
已有多种技术被研究用于将词、属性、图像等各类组件映射至嵌入空间。其中多数将目标实体的嵌入表示估计为投影空间中的一个点。某些模型(如Word2Gauss)假设嵌入表示背后存在概率分布,从而能够更细致地捕捉并考虑嵌入目标组件含义的散布或方差。我们研究了将嵌入表示估计为概率分布的方法,用于解释时尚领域中抽象且难以理解的术语。诸如“休闲”“成人休闲”“甜美休闲”“正装”等术语极具主观性与抽象性,专家与非专家都难以理解,这阻碍了用户尝试新时尚。我们提出一种端到端模型,称为对偶高斯视觉-语义嵌入,其在同一投影空间中映射图像与属性,并通过其广泛应用实现对这些术语含义的解释。我们通过涉及图像与属性映射、图像检索与重排序技术的多方面实验,以及对损失函数中距离度量的详尽理论/解析讨论,证明了所提方法的有效性。
引用
@article{arxiv.2210.17417,
title = {Fashion-Specific Attributes Interpretation via Dual Gaussian Visual-Semantic Embedding},
author = {Ryotaro Shimizu and Masanari Kimura and Masayuki Goto},
journal= {arXiv preprint arXiv:2210.17417},
year = {2022}
}