中文

嵌入的约束非仿射对齐

机器学习 2021-11-22 v4 机器学习

摘要

嵌入是数据分析任务的基本构建块之一。嵌入已经是大型语言模型(LLM)和图像分析的重要工具,并且其应用正在扩展到许多其他研究领域。这些分布式表示的生成通常是数据和计算昂贵的过程;然而在生成之后对它们进行整体分析和调整仍是一个发展中的领域。在本文中,我们首先基于特征是否可被学习,提出一种非常通用的量化度量来衡量嵌入数据中特征的存在。然后我们设计了一种方法来去除或缓解嵌入中不需要的特征,同时保留数据的本质结构。我们使用域对抗网络(Domain Adversarial Network,DAN)来生成非仿射变换,但添加了约束以确保嵌入的本质结构得以保持。我们的经验结果表明,所提算法在多个数据集上显著优于最先进的无监督算法,包括来自工业界的新颖应用。

关键词

引用

@article{arxiv.1910.05862,
  title  = {Constrained Non-Affine Alignment of Embeddings},
  author = {Yuwei Wang and Yan Zheng and Yanqing Peng and Chin-Chia Michael Yeh and Zhongfang Zhuang and Das Mahashweta and Bendre Mangesh and Feifei Li and Wei Zhang and Jeff M. Phillips},
  journal= {arXiv preprint arXiv:1910.05862},
  year   = {2021}
}