中文

通过正则化低秩参数更新提高个性化搜索效果

材料科学 2025-06-13 v1 介观与纳米尺度物理

摘要

个性化视觉语言检索旨在从仅少量示例中识别新概念(例如"我的狗Fido")。这一任务具有挑战性,因为它不仅需要从少量图像中学习新概念,还需要将个人知识与通用知识整合,以在不同情境中识别该概念。本文展示了如何有效地为个性化视觉语言检索适配视觉语言双编码器模型的内部表征。我们发现,对语言编码器最终一层少量参数的正则化低秩适配是一种高度有效的替代方案,可用于识别个人概念而又保留通用知识。此外,我们探索了组合多个已学习个人概念参数的策略,发现参数相加效果良好。为评估在微调表征中保留通用知识的程度,我们引入了一个基于由视觉语言模型生成的描述诗句来衡量图像检索准确性的指标。我们的方法在两个针对自然语言查询的个性化图像检索基准测试(DeepFashion2和ConCon-Chi)上实现了状态-of-the-art准确率,个人检索准确率显著优于先前技术4%-22%。

关键词

引用

@article{arxiv.2506.10181,
  title  = {Entangled Interlocked Diamond-like (Diamondiynes) Lattices},
  author = {C. M. O. Bastos and E. J. A. dos Santos and R. A. F. Alves and Alexandre C. Dias and L. A. Ribeiro Junior and D. S. Galvão},
  journal= {arXiv preprint arXiv:2506.10181},
  year   = {2025}
}

备注

6 pages