SynCDR:利用合成数据训练跨域检索模型
计算机视觉与模式识别
2024-03-20 v2 人工智能
摘要
在跨域检索中,模型需要从两个视觉域中识别出属于同一语义类别的图像。例如,给定一个物体的草图,模型需要从在线商店的商品目录中检索出它的真实图像。此类问题的标准方法是学习一个图像特征空间,使得欧氏距离能够反映相似性。即使在没有可能成本高昂的人工标注的情况下,先前的方法利用无标注图像进行训练也能表现得相当不错。我们的问题约束将此进一步推广到两个域在训练数据中不一定共享任何公共类别的场景。当所讨论的两个域来自记录不同人身份的某种生物特征传感器的不同版本时,就会出现这种情况。我们提出了一种简单的解决方案,即生成合成数据来填补跨域缺失的类别示例。我们通过将图像从一个视觉域保类别地转换到另一个视觉域来实现这一点。我们比较了专门针对一对域训练以进行此转换的方法,以及可以通过提示使用大规模预训练文本到图像扩散模型的方法,发现后者能够生成更好的替代合成数据,从而得到更准确的跨域检索模型。我们最佳的 SynCDR 模型性能可超越先前方法达 15\%。我们的工作代码可在 https://github.com/samarth4149/SynCDR 获取。
引用
@article{arxiv.2401.00420,
title = {SynCDR : Training Cross Domain Retrieval Models with Synthetic Data},
author = {Samarth Mishra and Carlos D. Castillo and Hongcheng Wang and Kate Saenko and Venkatesh Saligrama},
journal= {arXiv preprint arXiv:2401.00420},
year = {2024}
}
备注
Pre-print