中文

用于CLIP中可解释且可控文本嵌入的语义标记重加权

机器学习 2024-10-17 v2 计算与语言 计算机视觉与模式识别

摘要

视觉语言模型(VLM)如CLIP中的文本编码器在将文本输入转换为与图像共享的嵌入空间方面发挥着关键作用,从而通过自然语言促进视觉任务的解释性分析。尽管不同文本元素在特定语境下具有不同的重要性,但在构建文本嵌入时考虑其重要性变化的努力仍不足。我们提出了语义标记重加权框架以构建可解释文本嵌入( ST oRI ),并 incorporates 可控性。SToRI通过根据语境重要性对语义元素进行差异化加权,细化了CLIP中的文本编码过程,使其能够响应数据驱动的见解和用户偏好进行更精细的强调控制。通过针对用户偏好进行few-shot图像分类和图像检索的全面实验,证明了SToRI的有效性。

关键词

引用

@article{arxiv.2410.08469,
  title  = {Semantic Token Reweighting for Interpretable and Controllable Text Embeddings in CLIP},
  author = {Eunji Kim and Kyuhong Shim and Simyung Chang and Sungroh Yoon},
  journal= {arXiv preprint arXiv:2410.08469},
  year   = {2024}
}

备注

Accepted at EMNLP 2024 Findings