中文

基于跨模态匹配的自动创意选择

计算机视觉与模式识别 2024-05-02 v1 信息检索

摘要

应用开发人员通过创建产品页面中的应用图像并投标搜索词来广告他们的应用程序。此时,应用图像必须与搜索词高度相关。解决这一问题需要一种图像-文本匹配模型来预测所选图像与搜索词之间的匹配质量。在本工作中,我们提出了一种基于对预训练LXMERT模型进行微调的全新方法来匹配应用图像与搜索词。我们显示,与CLIP模型和基线使用Transformer模型处理搜索词、ResNet模型处理图像的方法相比,我们在匹配准确率方面显著提高。我们使用两种标签进行评估:广告方关联的(图像、搜索词)对用于给定应用程序,以及人类对(图像、搜索词)对相关性的人类评级。我们的 approach 获得了0.96的AUC得分,优于使用Transformer+ResNet基线和微调的CLIP模型分别提高了8%和14%。对于人类标记的ground truth,我们的方法获得了0.95的AUC得分,优于Transformer+ResNet基线和微调的CLIP模型分别提高了16%和17%。

关键词

引用

@article{arxiv.2405.00029,
  title  = {Automatic Creative Selection with Cross-Modal Matching},
  author = {Alex Kim and Jia Huang and Rob Monarch and Jerry Kwac and Anikesh Kamath and Parmeshwar Khurd and Kailash Thiyagarajan and Goodman Gu},
  journal= {arXiv preprint arXiv:2405.00029},
  year   = {2024}
}