基于几何保持正则化的可表达得分基分布匹配
计算与语言
2025-06-18 v1 硬件体系结构
机器学习
编程语言
软件工程
摘要
分布匹配(DM)是一种通用的领域无关表示学习技术,已用于公平分类、领域适应和领域转换等任务。非参数 DM 方法在可扩展性方面受限,而对抗 DM 方法则存在不稳定和模式崩溃的问题。虽然基于似然的方法是有前景的选择,但它们通常通过固定先验或需要显式密度模型(如流模型)施加不必要的偏见,或者训练困难。我们通过引入基于得分的先验分布来训练基于似然的 DM 方法来解决这一限制。我们的关键洞察是,梯度-based DM 训练仅需要先验的得分函数——而无需其密度——这使我们能够通过去噪得分匹配训练先验,从而消除固定先验(如 VAE 中的固定先验)带来的偏见,同时实现更有效地利用几何保持正则化,同时避免学习显式先验密度模型(如基于流的先验)的挑战。我们的方法还显示出比其他扩散基先验(如 LSGM)更好的稳定性和计算效率。此外,实验表明,我们的方法在多个任务上均表现出色,确立了基于得分的方法作为稳定有效的分布匹配方法。源代码可在 https://github.com/inouye-lab/SAUB 上获取。
引用
@article{arxiv.2506.14606,
title = {Guaranteed Guess: A Language Modeling Approach for CISC-to-RISC Transpilation with Testing Guarantees},
author = {Ahmed Heakl and Sarim Hashmi and Chaimaa Abi and Celine Lee and Abdulrahman Mahmoud},
journal= {arXiv preprint arXiv:2506.14606},
year = {2025}
}
备注
Project page: https://ahmedheakl.github.io/Guaranteed-Guess/