中文

Sticker820K:赋能表情贴纸交互式检索

计算机视觉与模式识别 2023-06-13 v1 人工智能

摘要

表情贴纸已成为现代通信中无处不在的一部分,通过视觉图像传达复杂的情感。为了促进更强大的贴纸分析算法的开发,我们提出了一个大规模中文贴纸数据集,即 Sticker820K,它包含 82 万个图像-文本对。每个贴纸都有丰富且高质量的文本标注,包括描述、光学字符、情感标签和风格分类。尽管自然图像领域的视觉-语言任务已得到充分研究,但由于自然图像与情感图像数据之间的本质差异,直接将 CLIP 等模型应用于贴纸数据并非最优解决方案。因此,我们提出了 StickerCLIP 作为 Sticker820K 数据集上的基准模型。对于文本到图像的检索任务,我们的 StickerCLIP 展现了对 CLIP 的强大优越性,在 Sticker820K 测试集上的平均召回率绝对提升了 66.0%。此外,我们尝试通过提示调优来扩展最近流行的大语言模型(LLM),整合其贴纸检索能力,并允许用户通过指令检索贴纸。我们验证了该方法的可行性,展示了提示调优在扩展 LLM 能力同时不影响上游任务质量的巨大潜力。

关键词

引用

@article{arxiv.2306.06870,
  title  = {Sticker820K: Empowering Interactive Retrieval with Stickers},
  author = {Sijie Zhao and Yixiao Ge and Zhongang Qi and Lin Song and Xiaohan Ding and Zehua Xie and Ying Shan},
  journal= {arXiv preprint arXiv:2306.06870},
  year   = {2023}
}