中文

预训练语言模型在通用文本嵌入中的作用:综述

计算与语言 2025-11-27 v2

摘要

由于其在诸多自然语言处理(NLP)任务中的有效性,文本嵌入(text embeddings)正受到日益关注,包括检索、分类、聚类、双语挖掘和摘要等。随着预训练语言模型(pretrained language models, PLMs)的出现,通用文本嵌入(general-purpose text embeddings, GPTE)因其能够生成丰富且可迁移表示而受到广泛关注。GPTE的通用架构通常利用PLMs来获取稠密文本表示,然后通过大规模成对数据集进行对比学习优化。本综述在PLMs时代对GPTE进行全面概述,重点考察PLMs在推动其发展中所发挥的作用。我们首先检阅其基本架构,描述PLMs在GPTE中的基本作用,即嵌入提取、表达力增强、训练策略、学习目标和数据构建。随后我们描述PLMs所启发的高级作用,包括多语言支持、多模态集成、代码理解和场景特定适应。最后,我们指出超越传统改进目标的潜在未来研究方向,包括排序集成、安全性考量、偏见缓解、结构信息融合以及嵌入的认知扩展。本综述旨在为新手和已有研究者提供当前GPTE状态及其未来潜力的宝贵参考。

关键词

引用

@article{arxiv.2507.20783,
  title  = {On The Role of Pretrained Language Models in General-Purpose Text Embeddings: A Survey},
  author = {Meishan Zhang and Xin Zhang and Xinping Zhao and Shouzheng Huang and Baotian Hu and Min Zhang},
  journal= {arXiv preprint arXiv:2507.20783},
  year   = {2025}
}

备注

45 pages, 4 figures, 9 tables