中文

REZE:用于域自适应文本嵌入预微调的表示正则化

计算与语言 2026-04-22 v2 人工智能

摘要

最近的文本嵌入模型通常通过对比预微调(PFT)适应特定领域,但该方法通常在零散且异构的任务集合上进行。然而,这种方法会引入任务引发的偏差以及领域知识,导致表示变化不可控,扭曲预训练嵌入几何结构,并造成显著的性能下降。为解决此问题,我们提出了REZE—a种显式控制嵌入预微调期间表示变化的表示正则化框架。REZE基于锚点-正样本对的关系,在特征空间中分解这些关系,然后测量每个特征分量上的任务间离散程度,以识别任务变异方向,并应用自适应软收缩来抑制任务引发的噪声,同时保留任务不变的语义结构,且无需推理时开销。在多个嵌入 backbone 和专业基准测试中进行的实验表明,REZE 在大多数设置下均优于标准预微调和各向同性后处理正则化方法,保持稳定性,而现有 PFT 变体在此往往会崩溃。嵌入空间分析进一步确认,REZE 诱导的变化与原始嵌入流形对齐,强调表示变化控制是鲁棒嵌入预微调下的关键原则。

关键词

引用

@article{arxiv.2604.17257,
  title  = {REZE: Representation Regularization for Domain-adaptive Text Embedding Pre-finetuning},
  author = {Seungmin Lee and Jeonghwan Lee and Hyunkuk Lim and Sejoon Kim and Mingi Sung},
  journal= {arXiv preprint arXiv:2604.17257},
  year   = {2026}
}

备注

ACL 2026 Main