中文

COBRA:COmBinatorial Retrieval Augmentation 用于少样本适应

机器学习 2025-04-01 v2

摘要

检索增强技术,即从大型辅助数据池中检索额外数据,以提升在数据稀缺情形下的模型性能。 先前方法仅采用最近邻策略进行数据选择,从而检索与目标任务中的实例高度相似的辅助样本。 然而,这些方法容易选择高度冗余的样本,因为它们未纳入任何多样性概念。 本文首先表明,先前检索增强式少样本适应设置中使用的数据选择策略可由一类称为组合互信息(CMI)的函数进行泛化。 我们随后提出 COBRA (COmBinatorial Retrieval Augmentation),其采用另一种考虑目标数据集中多样性和相似性的 CMI 测度。 当使用从 LAION-2B 中检索样本时,COBRA 在图像分类任务和少样本学习技术上 consistently 优于先前检索方法。 COBRA 对检索成本几乎没有额外的计算开销,却为下游模型性能带来显著提升。

关键词

引用

@article{arxiv.2412.17684,
  title  = {COBRA: COmBinatorial Retrieval Augmentation for Few-Shot Adaptation},
  author = {Arnav M. Das and Gantavya Bhatt and Lilly Kumari and Sahil Verma and Jeff Bilmes},
  journal= {arXiv preprint arXiv:2412.17684},
  year   = {2025}
}

备注

Accepted at CVPR 2025