沿广义测地线插值生成合成数据集
机器学习
2023-06-13 v1 人工智能
摘要
用于预训练机器学习模型的数据通常由异构数据集的集合组成。尽管在不可知设置下对它们的并集进行训练是合理的,但当目标领域(即模型最终将使用的领域)已知时,这可能是次优的。在这种情况下,理想的做法是仅在与目标数据集最相似的数据集上进行预训练。我们不将此选择局限于预训练集合中已有的数据集,而是探索将此搜索扩展到所有可合成为它们“组合”的数据集。我们将此类组合定义为多数据集插值,通过最优传输(OT)理论中的广义测地线概念进行形式化。我们使用最近提出的带标签数据集间的距离概念来计算这些测地线,并基于此推导出替代插值方案:使用重心投影或最优传输映射,后者使用最近的神经 OT 方法计算。这些方法具有可扩展性、高效性,并且显著地,甚至可用于在具有不同且不相关标签集的数据集之间进行插值。通过计算机视觉迁移学习中的多项实验,我们证明这是一种有前景的按需目标数据集合成新方法。
引用
@article{arxiv.2306.06866,
title = {Generating Synthetic Datasets by Interpolating along Generalized Geodesics},
author = {Jiaojiao Fan and David Alvarez-Melis},
journal= {arXiv preprint arXiv:2306.06866},
year = {2023}
}