聚类清除损失:用于等价突变检测的 Transformer 嵌入结构化
机器学习
2025-07-29 v1
摘要
最近的预训练 Transformer 模型在各种代码处理任务中取得了卓越性能。然而,尽管这些模型在优化决策边界方面有效,常用的下游分类任务微调方法——基于距离的方法或训练额外的分类头——往往未能充分结构化嵌入空间以反映细致的类内语义关系。等价代码突变检测就是这类任务,嵌入空间的质量对模型性能至关重要。我们引入一种新框架,将交叉熵损失与深度度量学习目标集成,称为聚类清除损失 (Cluster Purge Loss)。该目标不同于常规方法,专注于调整每个类的细粒度差异,通过动态调整的边界鼓励基于语义等效性对类中心的分离。采用 UniXCoder 作为基础模型,我们的方法在等价突变检测领域实现了最先进的性能,并产生更具可解释性的嵌入空间。
引用
@article{arxiv.2507.20078,
title = {Cluster Purge Loss: Structuring Transformer Embeddings for Equivalent Mutants Detection},
author = {Adelaide Danilov and Aria Nourbakhsh and Christoph Schommer},
journal= {arXiv preprint arXiv:2507.20078},
year = {2025}
}
备注
11 pages, 6 figures