面向组合零样本学习的自注意力状态-对象加权组合
计算机视觉与模式识别
2025-12-23 v1 人工智能
摘要
对象识别已在 various 行业广泛普及。然而,大多数现有应用仅限于识别对象本身,而不考虑其关联状态。同时识别状态与对象的能力仍较为少见。一种解决方法是将状态和对象视为训练时的单一类别,但这种方法在数据收集和训练方面存在挑战,因为需要为所有可能的组合提供全面的数据。组合零样本学习(CZSL)通过将状态和对象视为训练时的独立类别来克服这一问题。CZSL 促进了即使在不存在每个可想象组合数据的情况下,也能识别新组合。当前的最新方法 KG-SP 通过为状态和对象训练不同的分类器,同时利用语义模型评估组合组合的合理性。然而,KG-SP 在状态和对象识别方面的准确率仍可进一步提高,且未考虑组合过程中对状态和对象的加权。在本研究中,我们提出了 SASOW,这是 KG-SP 的一种改进方案,考虑了组合过程中对状态和对象的加权,从而提高了组合识别的准确率。首先,我们将自注意力机制引入状态和对象的分类器,显著提升了两者的识别准确率。此外,我们在组合过程中引入状态和对象的加权,以生成更合理、更准确的组合。我们的验证过程在三个 established benchmark 数据集上进行。实验结果表明,与 OW-CZSL 方法相比,SASOW 在 MIT-States、UT Zappos 和 C-GQA 数据集上分别在未见组合的准确率上提高了 2.1%、1.7% 和 0.4%。
引用
@article{arxiv.2512.18969,
title = {Self-Attention with State-Object Weighted Combination for Compositional Zero Shot Learning},
author = {Cheng-Hong Chang and Pei-Hsuan Tsai},
journal= {arXiv preprint arXiv:2512.18969},
year = {2025}
}