URECA:语义代码搜索适应性偏移背后隐藏两组最小覆盖问题的链
人工智能
2025-02-12 v1
摘要
适应性是指模型学习训练分布之外模式的过程。在一般情况下,这种适应被形式化为最小熵问题。然而,最小熵问题存在固有的局限性——移位初始化级联现象。我们通过 Lebesgue 积分扩展了最小熵问题与最小覆盖问题之间的关系,这一扩展揭示了最小熵问题内部机制忽略了解耦表示之间的关系,从而导致移位初始化级联。基于此分析,我们引入了一种新型聚类算法——基于 Union-find 的递归聚类算法(URECA)。URECA 是一种高效的聚类算法,利用解耦表示之间的关系。URECA 的更新规则依赖于阈值可更新 stationary 假设(Thresholdly-Updatable Stationary Assumption),该假设是 stationary 假设的一个公开版本。该假设有助于基于解耦表示之间的关系,以无误差方式传输解耦表示。URECA 还利用仿真技巧高效地聚类解耦表示。广泛的评估表明,URECA 在针对各种类型偏移的少样本适应中实现一致的性能提升,并在查询偏移情景下的 CoSQA 上达到 state-of-the-art 性能。
引用
@article{arxiv.2502.07494,
title = {URECA: The Chain of Two Minimum Set Cover Problems exists behind Adaptation to Shifts in Semantic Code Search},
author = {Seok-Ung Choi and Joonghyuk Hahn and Yo-Sub Han},
journal= {arXiv preprint arXiv:2502.07494},
year = {2025}
}