中文

PEARL:面向标签高效表示学习的原型增强对齐及来自数字治理通信系统的部署驱动洞察

机器学习 2026-01-27 v1 人工智能 计算与语言 信息检索

摘要

在许多已部署系统中,新文本输入是通过检索相似的过往案例来处理的,例如在数字治理平台中路由和回复市民消息。当这些系统失效时,问题往往不在于语言模型本身,而在于嵌入空间中的最近邻对应到了错误的案例。现代机器学习系统越来越依赖于由大型预训练模型与句子编码器生成的固定高维嵌入。在实际部署中,标签稀缺,领域随时间漂移,重训练基础编码器昂贵或不可行。因此,下游性能严重依赖于嵌入几何。然而,原始嵌入往往与最近邻检索、相似性搜索以及直接在嵌入上操作的轻量级分类器所需的局部邻域结构对齐不佳。我们提出 PEARL(Prototype-Enhanced Aligned Representation Learning),一种标签高效的方法,利用有限的监督将嵌入向类原型进行软对齐。该方法重塑局部邻域几何,同时保留维度并避免激进投影或坍缩。其目标在于弥合纯粹无监督后处理(其增益有限且不一致)与需要大量标注数据的全监督投影之间的鸿沟。我们在从极端标签稀缺到更高标签设定的受控标签机制下评估 PEARL。在标签稀缺条件下,PEARL 显著提升了局部邻域质量,相较于原始嵌入实现了 25.7% 的增益,相较于强大的无监督后处理实现了超过 21.1% 的增益,这恰好是在基于相似性的系统最为脆弱的机制下。

关键词

引用

@article{arxiv.2601.17495,
  title  = {PEARL: Prototype-Enhanced Alignment for Label-Efficient Representation Learning with Deployment-Driven Insights from Digital Governance Communication Systems},
  author = {Ruiyu Zhang and Lin Nie and Wai-Fung Lam and Qihao Wang and Xin Zhao},
  journal= {arXiv preprint arXiv:2601.17495},
  year   = {2026}
}

备注

15 pages, 1 figure