CoDiEmb:面向信息检索和语义文本相似性的协同且不冲突的统一表示学习框架
计算与语言
2025-09-30 v2
摘要
学习在多样化下游任务中表现卓越的统一文本嵌入仍是表示学习的核心目标,但负迁移仍是持久性挑战。这一挑战在同时为信息检索(IR)和语义文本相似性(STS)这两个关键但根本不同任务单一编码器进行联合训练时尤为突出,由于粗糙的共同训练通常会导致严峻的性能权衡。我们认为解决这一冲突需要系统性地在训练管道各阶段解耦任务特定的学习信号。为此,我们引入CoDiEmb,一个在协同与不冲突方面调和IR和STS要求的统一框架。CoDiEmb集成了三个关键创新,以实现有效的联合优化:(1)任务特化目标配合动态采样器,形成单任务批次并平衡每个任务的更新,从而防止梯度干扰。对于IR,我们采用包含多个正样本和硬负样本的对比损失,并增强跨设备采样。对于STS,我们采用顺序感知目标,直接优化相关性和排序一致性。(2)一种delta引导的模型融合策略,通过分析每个参数与其预训练初始化偏差的程度,计算细粒度的合并权重,证明比传统的Model Soup更有效。(3)一个高效的单阶段训练管道,易于实现且收敛稳定。在15个标准IR和STS基准测试中对三个基本编码器进行了广泛实验,验证了CoDiEmb的有效性。我们的结果和分析表明,该框架不仅缓解了跨任务的权衡,还在嵌入空间的几何特性方面实现了可衡量的改进。
引用
@article{arxiv.2508.11442,
title = {CoDiEmb: A Collaborative yet Distinct Framework for Unified Representation Learning in Information Retrieval and Semantic Textual Similarity},
author = {Bowen Zhang and Zixin Song and Chunquan Chen and Qian-Wen Zhang and Di Yin and Xing Sun},
journal= {arXiv preprint arXiv:2508.11442},
year = {2025}
}