将对手转化为盟友:逆转多模态电子商务产品检索中的排版攻击
机器学习
2025-11-10 v1
摘要
电子商务平台的多模态产品检索系统依赖有效地组合视觉和文本信号以提高搜索相关性和用户体验。然而,诸如 CLIP 等视觉-语言模型对排版攻击(即在图像中嵌入误导或无关文本以扭曲模型预测)高度脆弱。本文提出了一种新方法,通过在产品图像上直接渲染相关文本内容(如标题、描述)以进行视觉-文本压缩,从而加强图像-文本对齐并提升多模态产品检索性能。我们在三个垂直领域的电子商务数据集(运动鞋、手提包和交易卡)上使用六个最先进的视觉基础模型进行评估。我们的实验在不同类别和模型家族中显示出一致的单模态和多模态检索准确率改进。我们的发现表明,直观地渲染产品元数据是一种简单而有效的提升零样本多模态检索在电子商务应用中的性能的方法。
引用
@article{arxiv.2511.05325,
title = {Turning Adversaries into Allies: Reversing Typographic Attacks for Multimodal E-Commerce Product Retrieval},
author = {Janet Jenq and Hongda Shen},
journal= {arXiv preprint arXiv:2511.05325},
year = {2025}
}